Skip to content
Назад к блогу
Инструкции

Как сгенерировать картинку по фото нейросетью в 2026 году

Как сгенерировать картинку по фото нейросетью в 2026: сохранение лица и стиля, img2img, лучшие модели без VPN. Пошаговый гайд с примерами промптов.

AgentHere Team
AgentHere TeamАвтор
Обновлено: 1 августа 2026 г.11 мин чтения

Что значит «сгенерировать картинку по фото»

Сгенерировать картинку по фото — значит создать новое изображение, которое перенимает лицо, стиль или композицию готового снимка. В отличие от генерации с нуля, нейросеть получает референс: ваш портрет, кадр с удачной позой или пример фирменного стиля — и перестраивает его по текстовому промпту. Так получают аватары «в стиле аниме» с узнаваемыми чертами лица, серии снимков одного персонажа в разных сценах, рекламные кадры с одним и тем же продуктом или перенос живописной манеры с картины на фотографию. Если задача — сгенерировать картинку нейросетью не из пустоты, а из уже существующего кадра, по состоянию на август 2026 года есть выбор как минимум из семи моделей: FLUX.1 Kontext, Qwen-Image-Edit, Alice AI ART 2.0, Kandinsky 3.1, Nano Banana Pro, Midjourney и GLM-Image. Ниже разбираем, чем они отличаются, где работают без VPN и как получить предсказуемый результат без «плывущего» лица и битых рук.

Чем генерация по фото отличается от генерации с нуля

Технически это семейство режимов, которые в документациях называют image-to-image, редактированием по инструкции или генерацией по референсу. Их объединяет одно: на вход подаётся хотя бы одно изображение, и оно влияет на результат сильнее, чем текст. Практически различают четыре подзадачи.

  1. Image-to-image (img2img). Модель берёт ваш снимок как каркас и перестраивает его в новом стиле или сеттинге: фотография становится акварелью, киберпанком, ретро-плакатом. Композиция и поза сохраняются, текстура меняется.
  2. Сохранение идентичности лица (identity preservation). Цель — чтобы человек на новых кадрах оставался узнаваемым в разных сценах: в костюме, на пляже, в аниме-стилистике. Это самая капризная задача: модель должна «запомнить» черты лица и пронести их через новый контекст. Инструменты вроде InstantID и подходы, описанные в работах по идентификационному сохранению, существуют именно для неё.
  3. Перенос стиля (style transfer). С референса снимается не содержание, а манера: палитра, мазок, освещение. В Midjourney для этого служит --sref, в Qwen-Image-Edit — отдельный режим style transfer, а Яндекс отмечает, что после объединения генерации и редактирования в одной модели знания о редких визуальных концептах переносятся между задачами автоматически.
  4. Мультиреференс. На вход подают два-три изображения: с одного берут лицо, с другого — одежду, с третьего — фон. Так собирают «меня в костюме из этого кадра на фоне того города».

Практическое правило: чем точнее нужно сохранить лицо, тем меньше свободы оставляйте модели в промпте. Опишите сцену, но не прописывайте внешность — иначе текст начнёт «перетягивать» лицо с референса, и идентичность поплывёт.

Какие нейросети умеют генерировать картинку по фото в 2026

Рынок заметно сдвинулся: открытые модели догнали проприетарные по качеству редактирования, а российские сервисы получили собственные унифицированные модели. Сводка по состоянию на август 2026:

МодельРежим по референсуЛицо / персонажДоступ в РФ
FLUX.1 Kontext (Black Forest Labs)img2img, локальное и глобальное редактированиеЗаявлено сохранение персонажа между сценамиОткрытые веса; запуск локально и через API-партнёров
Qwen-Image-Edit (Alibaba, 3-е пок.)img2img, до 3 референсов, встроенный ControlNetРедактирование и перенос стиля; лицо — через референсОткрытые веса и API
Alice AI ART 2.0 (Яндекс)Единая генерация + редактирование+23% запросов на персонажей; входит в группу мировых лидеров по редактированиюБез VPN — в «Алисе AI» и «Шедевруме»
Kandinsky 3.1 (Сбер)Преимущественно text-to-image; есть in/outpaintingСильная сторона — T2I, а не face-idБез VPN, открыто
Nano Banana Pro / Gemini 3 Pro Image (Google)Многораундовое редактирование, слой «Thinking»Сохранение объекта и персонажа между шагамиТолько VPN + иностранная карта
Midjourney V8.x--sref (стиль) и Omni Reference --oref (персонаж); --cref устарел--cref остался в V6; в V7+ заменён на Omni ReferenceТолько VPN + иностранная карта
GLM-Image (Z.AI)T2I и редактирование; устойчивость субъекта в многооконных кадрах№1 среди открытых по рендеру текста; $0,015/картинкаЧерез AgentHere — без VPN, оплата в рублях

Коротко о каждой модели

FLUX.1 Kontext от Black Forest Labs — это модель на 12 млрд параметров, которая, по заявлению разработчиков, «фокусируется исключительно на задачах редактирования»: итеративной правке, сохранении персонажа в разных сценах и локальной правке деталей. Веса выложены открыто под лицензией FLUX.1 Non-Commercial, модель совместима с ComfyUI, HuggingFace Diffusers и TensorRT, а на бенчмарке KontextBench обходит открытые аналоги и Gemini-Flash Image (BFL). Для самостоятельной сборки — один из лучших вариантов, но требует GPU и опыта с ComfyUI.

Qwen-Image-Edit от Alibaba построен на 20-миллиардной базовой модели Qwen-Image, «третьего поколения» линейки, и переносит её возможности по рендеру текста в задачи редактирования (Hugging Face). Версия Qwen-Image-Edit-Plus принимает до трёх референсных изображений и включает встроенный ControlNet (Canny, Depth, Inpaint), что даёт точный контроль позы и композиции. Базовая модель поддерживает вставку и удаление объектов, перенос стиля и правку текста внутри картинки (Qwen blog).

Alice AI ART 2.0 — единая модель Яндекса, представленная 14 июля 2026 года. Раньше генерация и редактирование существовали как два независимых стека; теперь они работают в общей трансформерной архитектуре с единым механизмом обработки текста и изображений. Внедрённый модуль расширяет короткий запрос до подробного описания, что подняло точность следования инструкциям при редактировании примерно на 12%; после запуска число скачиваний в сценариях с текстом на картинке выросло на 37%, а запросов на конкретных персонажей — на 23% (CNews) (Коммерсантъ). По методике Bradley-Terry модель заняла второе место в text-to-image, уступив только Gemini 3.1 Flash, и вошла в группу мировых лидеров по редактированию. Технология уже работает в приложениях «Алиса AI» и «Шедеврум».

Kandinsky 3.1 от Сбера (AI Forever) — продолжение линейки на латентной диффузии: в основном text-to-image-модель с открытыми весами на HuggingFace (Сбер) (Hugging Face). Это хороший бесплатный вариант для генерации с нуля в русском интерфейсе, но сохранение конкретного лица по фото — не её сильная сторона; для такой задачи лучше брать модель с явным режимом редактирования или face-id.

Nano Banana Pro, он же Gemini 3 Pro Image, — флагман Google для генерации и редактирования: построен на Gemini 3 Pro со слоем «Thinking» (рассуждение перед генерацией пикселей), поддерживает многораундовую правку и доступен через Vertex AI (Google Blog) (Google DeepMind). Качество высокое, но из России сервис требует VPN и зарубежной карты.

Midjourney V8.x. Важное уточнение по параметрам: привычный --cref (Character Reference) остался в V6 и в V7/V8 заменён на Omni Reference (--oref), который переносит не только персонажа, но и объекты, транспорт и сцены (Midjourney Docs) (Omni Reference). Параметр --cw (character weight) регулирует детализацию: при --cw 100 берётся лицо, волосы и одежда, при --cw 0 — только лицо. Style Reference --sref переносит стиль и по-прежнему поддерживается. Документация прямо рекомендует использовать в качестве референса картинки, сгенерированные самим Midjourney, а не фото реальных людей: последние обычно не получаются похожими.

GLM-Image от Z.AI — гибридная архитектура «авторегрессионная модель 9B + диффузионный декодер 7B», открытая и позиционируемая как исследование «когнитивно-генеративного» направления, к которому относится и Nano Banana Pro (Z.AI Docs) (Z.AI Blog). Цена — $0,015 за изображение. Главные сильные стороны — текст в кадре: на бенчмарке CVTG-2K модель занимает первое место среди открытых с Word Accuracy 0,9116, а в многооконных кадрах поддерживает единый стиль и образ главного субъекта. Именно GLM-Image работает под капотом у AgentHere, где им можно пользоваться из России без VPN и оплачивать в рублях.

Как получить картинку по фото: пошаговый процесс

Независимо от модели, рабочий процесс укладывается в пять шагов.

  1. Подготовьте референс. Кадрировайте лицо по плечи, уберите лишний фон, выровняйте освещение. Чем «чище» входное фото, тем меньше шансов, что модель подтянет мусор фона в новый кадр. Для портретной идентичности берите анфас или лёгкий поворот, нейтральную мимику.
  2. Выберите режим. Для «меня в новом стиле» — img2img с одним референсом. Для серии с одним персонажем — character/omni reference. Для «перенеси эту палитру на другой кадр» — style reference (--sref в Midjourney или style transfer в Qwen-Image-Edit).
  3. Составьте промпт. Опишите сцену и стиль, но не дублируйте внешность, которая уже есть на референсе. Подробно о структуре промпта — в нашем гайде по промпт-инжинирингу. Подробнее о самих моделях генерации картинок — в обзоре «Нейросети для генерации изображений».
  4. Настройте силу референса. У Midjourney это --cw и вес Omni Reference; в Qwen-Image-Edit — набор ControlNet и вес стилевого референса; в ComfyUI-пайплайнах с FLUX.1 Kontext — доза шума (denoise). Начните со среднего значения и корректируйте по результату.
  5. Дорабатывайте итеративно. Сгенерируйте 4–8 вариантов, выберите лучший, подмешайте его обратно как референс и уточните промпт. Сохранение лица почти всегда требует 2–3 проходов, а не одного.

Пример рабочего промпта

[референс: портрет анфас] Мужчина 35 лет, мягкое утреннее окно слева, нейтральный серый фон, тёплый кинематографичный свет, съёмка на 85 мм, глубина резкости f/1.8, лёгкая текстура плёнки. Сохранить черты лица с референса, одежда — тёмный воротник-поло. Фотореализм, без искажений анатомии, кисти рук видны целиком.

Здесь внешность не описывается словами — её держит референс, а промпт задаёт свет, оптику и атмосферу. Слова «сохранить черты лица» явно подчёркивают задачу идентичности.

<!-- ИНФОГРАФИКА: Схема из 5 шагов генерации картинки по фото — референс-портрет, выбор режима img2img, промпт со светом и оптикой, ползунок силы референса, серия из 4 вариантов с узнаваемым лицом -->

Пять шагов генерации картинки по фото нейросетью: референс-портрет, режим img2img, промпт, сила референса, серия лиц

Почему лицо «плывёт» и что с этим делать

Три проблемы портят результат чаще всего: потеря идентичности, дефекты анатомии (особенно кисти рук) и «смешение» стилей.

Лицо не похоже. Главная причина — промпт перегружен описанием внешности, и он спорит с референсом. Решение: уберите из текста цвет глаз, форму подбородка, причёску; оставьте их на референс. Вторая причина — слишком высокий denoise или слишком низкий вес character reference: модель «перерисовывает» лицо заново. Поднимите вес референса или снизьте уровень шума. Третья — референс низкого качества: маленький, повёрнутый, в тени. Дайте модели чистый анфас.

Кисти рук и артефакты анатомии. Классическая слабость диффузионных моделей. Часть моделей обрабатывает это лучше: Яндекс сообщает, что после Alice AI ART 2.0 число скачиваний в текстовых сценариях выросло на 37% — индикатор того, что унифицированная архитектура повышает общую аккуратность (CNews). На практике: прописывайте руки в промпте («кисти видны целиком, по пять пальцев»), выбирайте позы, где руки спрятаны или заняты предметом, и пересоздавайте варианты с битыми конечностями через inpainting.

Стиль не переносится. Если нужен именно перенос стиля, используйте dedicated-режим (--sref в Midjourney, style transfer в Qwen-Image-Edit), а не обычный img2img — иначе модель перенесёт и содержание референса, и стиль непредсказуемо. Отдельные модели заточены под эту задачу лучше: например, существуют специализированные «content-preserving style transfer»-пайплайны на базе Qwen-Image-Edit. И помните: одно и то же имя модели не гарантирует одинаковый результат — запуск через официальный API, ComfyUI и сторонние агрегаторы может отличаться.

FAQ

Какая нейросеть лучше всего сохраняет лицо по фото?

Однозначного лидера нет. По заявлениям разработчиков, FLUX.1 Kontext хорошо держит персонажа между сценами, Midjourney через Omni Reference (--oref) даёт гибкий контроль веса, а Qwen-Image-Edit-Plus с тремя референсами и ControlNet — точный контроль позы. Для тех, кому важен доступ из России без VPN, практичный выбор — Alice AI ART 2.0 в «Шедевруме» или GLM-Image через AgentHere; при этом Kandinsky 3.1 сильнее именно в генерации с нуля. Сравнение моделей по задачам — в обзоре лучших нейросетей июля 2026.

Можно ли сгенерировать картинку по фото бесплатно и без VPN?

Да. В «Шедевруме» и «Алисе AI» от Яндекса редактирование доступно бесплатно — там работает Alice AI ART 2.0. Kandinsky 3.1 от Сбера также доступен в России без VPN. AgentHere даёт 1 000 000 токенов в качестве бонуса за регистрацию, оплата — в рублях, VPN не требуется; попробовать можно на странице регистрации. Midjourney, Nano Banana Pro и зарубежные API требуют VPN и иностранной карты — это факт доступности, а не рекомендация конкретного сервиса.

Чем img2img отличается от text-to-image?

Text-to-image создаёт изображение только из текста — модель сама придумывает внешность и композицию. Image-to-image (img2img) получает ещё и картинку-референс, которая задаёт каркас: позу, композицию, лицо или стиль. Гибридный случай — генерация по нескольким референсам, когда лицо берётся с одного изображения, одежда и фон — с других.

Какие параметры промпта отвечают за похожесть лица?

В Midjourney это --oref (в V7/V8) с весом и --cw (0 — только лицо, 100 — лицо, волосы, одежда). В ComfyUI-пайплайнах с FLUX.1 Kontext — уровень denoise и вес референса. В Qwen-Image-Edit — вес стилевого референса и набор ControlNet. Общее правило едино: чем выше вес референса и ниже степень перестроения, тем сильнее сохраняется идентичность, но тем меньше свободы у стиля.

Как сделать серию картинок с одним персонажем?

Используйте character/omni reference: зафиксируйте одно референсное изображение и генерируйте к нему сцены с разными промптами, не меняя референс между запусками. Так персонаж остаётся узнаваемым в костюме, на пляже, в аниме-стиле. AgentHere упрощает задачу через агентов и навыки — например, персонального ассистента можно научить шаблонам промптов, а тарифы — сравнить на странице цен.

Что дальше

Технология генерации по фото в 2026 году стабилизировалась: открытые модели (FLUX.1 Kontext, Qwen-Image-Edit, GLM-Image) сравнялись с проприетарными по качеству редактирования, а у российских пользователей появился полноценный выбор без VPN — Alice AI ART 2.0, Kandinsky 3.1 и AgentHere. Начните с простого: возьмите одно чистое фото, выберите модель, доступную из России, и сделайте серию из 4–8 вариантов, удерживая лицо референсом. Чтобы не собирать пайплайн вручную, попробуйте готового ассистента на AgentHere или установите десктоп-приложение — GLM-Image, оплата в рублях и 1 000 000 токенов бонусом уже внутри.

Источники

#сгенерировать картинку нейросетью #нейросеть фото #картинка по фото #генерация по референсу #промпт

Похожие статьи

Как сгенерировать картинку по фото нейросетью в 2026 году | AgentHere