Что значит «сгенерировать картинку по фото»
Сгенерировать картинку по фото — значит создать новое изображение, которое перенимает лицо, стиль или композицию готового снимка. В отличие от генерации с нуля, нейросеть получает референс: ваш портрет, кадр с удачной позой или пример фирменного стиля — и перестраивает его по текстовому промпту. Так получают аватары «в стиле аниме» с узнаваемыми чертами лица, серии снимков одного персонажа в разных сценах, рекламные кадры с одним и тем же продуктом или перенос живописной манеры с картины на фотографию. Если задача — сгенерировать картинку нейросетью не из пустоты, а из уже существующего кадра, по состоянию на август 2026 года есть выбор как минимум из семи моделей: FLUX.1 Kontext, Qwen-Image-Edit, Alice AI ART 2.0, Kandinsky 3.1, Nano Banana Pro, Midjourney и GLM-Image. Ниже разбираем, чем они отличаются, где работают без VPN и как получить предсказуемый результат без «плывущего» лица и битых рук.
Чем генерация по фото отличается от генерации с нуля
Технически это семейство режимов, которые в документациях называют image-to-image, редактированием по инструкции или генерацией по референсу. Их объединяет одно: на вход подаётся хотя бы одно изображение, и оно влияет на результат сильнее, чем текст. Практически различают четыре подзадачи.
- Image-to-image (img2img). Модель берёт ваш снимок как каркас и перестраивает его в новом стиле или сеттинге: фотография становится акварелью, киберпанком, ретро-плакатом. Композиция и поза сохраняются, текстура меняется.
- Сохранение идентичности лица (identity preservation). Цель — чтобы человек на новых кадрах оставался узнаваемым в разных сценах: в костюме, на пляже, в аниме-стилистике. Это самая капризная задача: модель должна «запомнить» черты лица и пронести их через новый контекст. Инструменты вроде InstantID и подходы, описанные в работах по идентификационному сохранению, существуют именно для неё.
- Перенос стиля (style transfer). С референса снимается не содержание, а манера: палитра, мазок, освещение. В Midjourney для этого служит
--sref, в Qwen-Image-Edit — отдельный режим style transfer, а Яндекс отмечает, что после объединения генерации и редактирования в одной модели знания о редких визуальных концептах переносятся между задачами автоматически. - Мультиреференс. На вход подают два-три изображения: с одного берут лицо, с другого — одежду, с третьего — фон. Так собирают «меня в костюме из этого кадра на фоне того города».
Практическое правило: чем точнее нужно сохранить лицо, тем меньше свободы оставляйте модели в промпте. Опишите сцену, но не прописывайте внешность — иначе текст начнёт «перетягивать» лицо с референса, и идентичность поплывёт.
Какие нейросети умеют генерировать картинку по фото в 2026
Рынок заметно сдвинулся: открытые модели догнали проприетарные по качеству редактирования, а российские сервисы получили собственные унифицированные модели. Сводка по состоянию на август 2026:
| Модель | Режим по референсу | Лицо / персонаж | Доступ в РФ |
|---|---|---|---|
| FLUX.1 Kontext (Black Forest Labs) | img2img, локальное и глобальное редактирование | Заявлено сохранение персонажа между сценами | Открытые веса; запуск локально и через API-партнёров |
| Qwen-Image-Edit (Alibaba, 3-е пок.) | img2img, до 3 референсов, встроенный ControlNet | Редактирование и перенос стиля; лицо — через референс | Открытые веса и API |
| Alice AI ART 2.0 (Яндекс) | Единая генерация + редактирование | +23% запросов на персонажей; входит в группу мировых лидеров по редактированию | Без VPN — в «Алисе AI» и «Шедевруме» |
| Kandinsky 3.1 (Сбер) | Преимущественно text-to-image; есть in/outpainting | Сильная сторона — T2I, а не face-id | Без VPN, открыто |
| Nano Banana Pro / Gemini 3 Pro Image (Google) | Многораундовое редактирование, слой «Thinking» | Сохранение объекта и персонажа между шагами | Только VPN + иностранная карта |
| Midjourney V8.x | --sref (стиль) и Omni Reference --oref (персонаж); --cref устарел | --cref остался в V6; в V7+ заменён на Omni Reference | Только VPN + иностранная карта |
| GLM-Image (Z.AI) | T2I и редактирование; устойчивость субъекта в многооконных кадрах | №1 среди открытых по рендеру текста; $0,015/картинка | Через AgentHere — без VPN, оплата в рублях |
Коротко о каждой модели
FLUX.1 Kontext от Black Forest Labs — это модель на 12 млрд параметров, которая, по заявлению разработчиков, «фокусируется исключительно на задачах редактирования»: итеративной правке, сохранении персонажа в разных сценах и локальной правке деталей. Веса выложены открыто под лицензией FLUX.1 Non-Commercial, модель совместима с ComfyUI, HuggingFace Diffusers и TensorRT, а на бенчмарке KontextBench обходит открытые аналоги и Gemini-Flash Image (BFL). Для самостоятельной сборки — один из лучших вариантов, но требует GPU и опыта с ComfyUI.
Qwen-Image-Edit от Alibaba построен на 20-миллиардной базовой модели Qwen-Image, «третьего поколения» линейки, и переносит её возможности по рендеру текста в задачи редактирования (Hugging Face). Версия Qwen-Image-Edit-Plus принимает до трёх референсных изображений и включает встроенный ControlNet (Canny, Depth, Inpaint), что даёт точный контроль позы и композиции. Базовая модель поддерживает вставку и удаление объектов, перенос стиля и правку текста внутри картинки (Qwen blog).
Alice AI ART 2.0 — единая модель Яндекса, представленная 14 июля 2026 года. Раньше генерация и редактирование существовали как два независимых стека; теперь они работают в общей трансформерной архитектуре с единым механизмом обработки текста и изображений. Внедрённый модуль расширяет короткий запрос до подробного описания, что подняло точность следования инструкциям при редактировании примерно на 12%; после запуска число скачиваний в сценариях с текстом на картинке выросло на 37%, а запросов на конкретных персонажей — на 23% (CNews) (Коммерсантъ). По методике Bradley-Terry модель заняла второе место в text-to-image, уступив только Gemini 3.1 Flash, и вошла в группу мировых лидеров по редактированию. Технология уже работает в приложениях «Алиса AI» и «Шедеврум».
Kandinsky 3.1 от Сбера (AI Forever) — продолжение линейки на латентной диффузии: в основном text-to-image-модель с открытыми весами на HuggingFace (Сбер) (Hugging Face). Это хороший бесплатный вариант для генерации с нуля в русском интерфейсе, но сохранение конкретного лица по фото — не её сильная сторона; для такой задачи лучше брать модель с явным режимом редактирования или face-id.
Nano Banana Pro, он же Gemini 3 Pro Image, — флагман Google для генерации и редактирования: построен на Gemini 3 Pro со слоем «Thinking» (рассуждение перед генерацией пикселей), поддерживает многораундовую правку и доступен через Vertex AI (Google Blog) (Google DeepMind). Качество высокое, но из России сервис требует VPN и зарубежной карты.
Midjourney V8.x. Важное уточнение по параметрам: привычный --cref (Character Reference) остался в V6 и в V7/V8 заменён на Omni Reference (--oref), который переносит не только персонажа, но и объекты, транспорт и сцены (Midjourney Docs) (Omni Reference). Параметр --cw (character weight) регулирует детализацию: при --cw 100 берётся лицо, волосы и одежда, при --cw 0 — только лицо. Style Reference --sref переносит стиль и по-прежнему поддерживается. Документация прямо рекомендует использовать в качестве референса картинки, сгенерированные самим Midjourney, а не фото реальных людей: последние обычно не получаются похожими.
GLM-Image от Z.AI — гибридная архитектура «авторегрессионная модель 9B + диффузионный декодер 7B», открытая и позиционируемая как исследование «когнитивно-генеративного» направления, к которому относится и Nano Banana Pro (Z.AI Docs) (Z.AI Blog). Цена — $0,015 за изображение. Главные сильные стороны — текст в кадре: на бенчмарке CVTG-2K модель занимает первое место среди открытых с Word Accuracy 0,9116, а в многооконных кадрах поддерживает единый стиль и образ главного субъекта. Именно GLM-Image работает под капотом у AgentHere, где им можно пользоваться из России без VPN и оплачивать в рублях.
Как получить картинку по фото: пошаговый процесс
Независимо от модели, рабочий процесс укладывается в пять шагов.
- Подготовьте референс. Кадрировайте лицо по плечи, уберите лишний фон, выровняйте освещение. Чем «чище» входное фото, тем меньше шансов, что модель подтянет мусор фона в новый кадр. Для портретной идентичности берите анфас или лёгкий поворот, нейтральную мимику.
- Выберите режим. Для «меня в новом стиле» — img2img с одним референсом. Для серии с одним персонажем — character/omni reference. Для «перенеси эту палитру на другой кадр» — style reference (
--srefв Midjourney или style transfer в Qwen-Image-Edit). - Составьте промпт. Опишите сцену и стиль, но не дублируйте внешность, которая уже есть на референсе. Подробно о структуре промпта — в нашем гайде по промпт-инжинирингу. Подробнее о самих моделях генерации картинок — в обзоре «Нейросети для генерации изображений».
- Настройте силу референса. У Midjourney это
--cwи вес Omni Reference; в Qwen-Image-Edit — набор ControlNet и вес стилевого референса; в ComfyUI-пайплайнах с FLUX.1 Kontext — доза шума (denoise). Начните со среднего значения и корректируйте по результату. - Дорабатывайте итеративно. Сгенерируйте 4–8 вариантов, выберите лучший, подмешайте его обратно как референс и уточните промпт. Сохранение лица почти всегда требует 2–3 проходов, а не одного.
Пример рабочего промпта
[референс: портрет анфас] Мужчина 35 лет, мягкое утреннее окно слева, нейтральный серый фон, тёплый кинематографичный свет, съёмка на 85 мм, глубина резкости f/1.8, лёгкая текстура плёнки. Сохранить черты лица с референса, одежда — тёмный воротник-поло. Фотореализм, без искажений анатомии, кисти рук видны целиком.
Здесь внешность не описывается словами — её держит референс, а промпт задаёт свет, оптику и атмосферу. Слова «сохранить черты лица» явно подчёркивают задачу идентичности.
<!-- ИНФОГРАФИКА: Схема из 5 шагов генерации картинки по фото — референс-портрет, выбор режима img2img, промпт со светом и оптикой, ползунок силы референса, серия из 4 вариантов с узнаваемым лицом -->Почему лицо «плывёт» и что с этим делать
Три проблемы портят результат чаще всего: потеря идентичности, дефекты анатомии (особенно кисти рук) и «смешение» стилей.
Лицо не похоже. Главная причина — промпт перегружен описанием внешности, и он спорит с референсом. Решение: уберите из текста цвет глаз, форму подбородка, причёску; оставьте их на референс. Вторая причина — слишком высокий denoise или слишком низкий вес character reference: модель «перерисовывает» лицо заново. Поднимите вес референса или снизьте уровень шума. Третья — референс низкого качества: маленький, повёрнутый, в тени. Дайте модели чистый анфас.
Кисти рук и артефакты анатомии. Классическая слабость диффузионных моделей. Часть моделей обрабатывает это лучше: Яндекс сообщает, что после Alice AI ART 2.0 число скачиваний в текстовых сценариях выросло на 37% — индикатор того, что унифицированная архитектура повышает общую аккуратность (CNews). На практике: прописывайте руки в промпте («кисти видны целиком, по пять пальцев»), выбирайте позы, где руки спрятаны или заняты предметом, и пересоздавайте варианты с битыми конечностями через inpainting.
Стиль не переносится. Если нужен именно перенос стиля, используйте dedicated-режим (--sref в Midjourney, style transfer в Qwen-Image-Edit), а не обычный img2img — иначе модель перенесёт и содержание референса, и стиль непредсказуемо. Отдельные модели заточены под эту задачу лучше: например, существуют специализированные «content-preserving style transfer»-пайплайны на базе Qwen-Image-Edit. И помните: одно и то же имя модели не гарантирует одинаковый результат — запуск через официальный API, ComfyUI и сторонние агрегаторы может отличаться.
FAQ
Какая нейросеть лучше всего сохраняет лицо по фото?
Однозначного лидера нет. По заявлениям разработчиков, FLUX.1 Kontext хорошо держит персонажа между сценами, Midjourney через Omni Reference (--oref) даёт гибкий контроль веса, а Qwen-Image-Edit-Plus с тремя референсами и ControlNet — точный контроль позы. Для тех, кому важен доступ из России без VPN, практичный выбор — Alice AI ART 2.0 в «Шедевруме» или GLM-Image через AgentHere; при этом Kandinsky 3.1 сильнее именно в генерации с нуля. Сравнение моделей по задачам — в обзоре лучших нейросетей июля 2026.
Можно ли сгенерировать картинку по фото бесплатно и без VPN?
Да. В «Шедевруме» и «Алисе AI» от Яндекса редактирование доступно бесплатно — там работает Alice AI ART 2.0. Kandinsky 3.1 от Сбера также доступен в России без VPN. AgentHere даёт 1 000 000 токенов в качестве бонуса за регистрацию, оплата — в рублях, VPN не требуется; попробовать можно на странице регистрации. Midjourney, Nano Banana Pro и зарубежные API требуют VPN и иностранной карты — это факт доступности, а не рекомендация конкретного сервиса.
Чем img2img отличается от text-to-image?
Text-to-image создаёт изображение только из текста — модель сама придумывает внешность и композицию. Image-to-image (img2img) получает ещё и картинку-референс, которая задаёт каркас: позу, композицию, лицо или стиль. Гибридный случай — генерация по нескольким референсам, когда лицо берётся с одного изображения, одежда и фон — с других.
Какие параметры промпта отвечают за похожесть лица?
В Midjourney это --oref (в V7/V8) с весом и --cw (0 — только лицо, 100 — лицо, волосы, одежда). В ComfyUI-пайплайнах с FLUX.1 Kontext — уровень denoise и вес референса. В Qwen-Image-Edit — вес стилевого референса и набор ControlNet. Общее правило едино: чем выше вес референса и ниже степень перестроения, тем сильнее сохраняется идентичность, но тем меньше свободы у стиля.
Как сделать серию картинок с одним персонажем?
Используйте character/omni reference: зафиксируйте одно референсное изображение и генерируйте к нему сцены с разными промптами, не меняя референс между запусками. Так персонаж остаётся узнаваемым в костюме, на пляже, в аниме-стиле. AgentHere упрощает задачу через агентов и навыки — например, персонального ассистента можно научить шаблонам промптов, а тарифы — сравнить на странице цен.
Что дальше
Технология генерации по фото в 2026 году стабилизировалась: открытые модели (FLUX.1 Kontext, Qwen-Image-Edit, GLM-Image) сравнялись с проприетарными по качеству редактирования, а у российских пользователей появился полноценный выбор без VPN — Alice AI ART 2.0, Kandinsky 3.1 и AgentHere. Начните с простого: возьмите одно чистое фото, выберите модель, доступную из России, и сделайте серию из 4–8 вариантов, удерживая лицо референсом. Чтобы не собирать пайплайн вручную, попробуйте готового ассистента на AgentHere или установите десктоп-приложение — GLM-Image, оплата в рублях и 1 000 000 токенов бонусом уже внутри.
Источники
- FLUX.1 Kontext [dev] — Open Weights for Image Editing — https://bfl.ai/blog/flux-1-kontext-dev
- GLM-Image — Overview, Z.AI Developer Documents — https://docs.z.ai/guides/image/glm-image
- GLM-Image: Auto-regressive for Dense-knowledge, Z.AI Blog — https://z.ai/blog/glm-image
- zai-org/GLM-Image, Hugging Face — https://huggingface.co/zai-org/GLM-Image
- «Яндекс» начал разрабатывать единую модель для генерации и редактирования изображений, CNews — https://ai.cnews.ru/news/line/2026-07-14_yandeks_nachal_razrabatyvat
- Яндекс обновил Alice AI ART для генерации изображений, Коммерсантъ — https://www.kommersant.ru/doc/8672536
- Alice AI ART 2.0: путь к unified-модели, Хабр — https://habr.com/ru/companies/yandex/articles/1058630/
- Qwen-Image-3.0: Rich Content, Authentic Details, Qwen Blog — https://qwen.ai/blog?id=qwen-image-3.0
- Qwen/Qwen-Image-Edit, Hugging Face — https://huggingface.co/Qwen/Qwen-Image-Edit
- Kandinsky 3.1 capabilities are now open-access, Сбер — https://www.sberbank.ru/ru/press_center/all/article?newsID=38624163-75a3-4f5b-ba61-8db43ead5e0f&blockID=1539®ionID=77&lang=ru&type=NEWS
- ai-forever/Kandinsky3.1, Hugging Face — https://huggingface.co/ai-forever/Kandinsky3.1
- Introducing Nano Banana Pro, Google Blog — https://blog.google/innovation-and-ai/products/nano-banana-pro/
- Gemini 3 Pro Image — Nano Banana Pro, Google DeepMind — https://deepmind.google/models/gemini-image/pro/
- Character Reference, Midjourney Docs — https://docs.midjourney.com/hc/en-us/articles/32162917505293-Character-Reference
- Omni Reference, Midjourney Docs — https://docs.midjourney.com/hc/en-us/articles/36285124473997-Omni-Reference