К содержимому

Генеративный ИИ — что это простыми словами, как работает, примеры

Генеративный ИИ — класс нейросетей, которые создают новый текст, изображения, звук или видео по запросу, опираясь на закономерности, выученные на больших наборах данных.

Генеративный ИИ — это класс моделей искусственного интеллекта, которые создают новый контент по запросу человека: текст, изображения, звук, видео или код. Модель не достаёт готовый ответ из базы, а собирает его заново из закономерностей, выученных на огромных наборах данных. Название пришло из английского generative AI — «порождающий ИИ».

Для стилиста и фотографа это рабочий инструмент, а не абстракция. На генеративных моделях построены онлайн-примерка по фото, замена вещи на снимке, фотосессии без студии и съёмка одежды на виртуальных моделях для карточек товаров. Понимать их устройство полезно по простой причине: так ясно, чего ждать от результата и где проверять его глазами.

Что такое генеративный ИИ и чем он отличается от обычного

Коротко: обычный ИИ распознаёт и оценивает, генеративный — создаёт. Классическая модель машинного обучения отвечает на вопрос «что это?»: отличает платье от юбки на снимке, прогнозирует спрос, отсеивает спам. Её ответ — метка, число или категория из заранее известного списка.

Генеративная модель отвечает на другую просьбу: «сделай такое». Она выдаёт то, чего до запроса не существовало: абзац текста, портрет в студийном свете, то же пальто в другом цвете. Два запуска с одинаковым запросом обычно дают два разных результата. В этом её сила и главный источник ошибок.

Распознающий ИИГенеративный ИИ
Что делаетклассифицирует, находит, прогнозируетсоздаёт текст, изображение, звук, видео
Результатметка, число, категорияконтент, которого не было
Пример в модеопределить тип вещи на фотопоказать эту вещь на другом человеке
Типичная ошибкаперепутал категориюуверенно дорисовал то, чего нет

Граница между ними не глухая. Во многих системах примерки работают обе части: сначала распознающая находит на фото человека, позу и одежду, потом генеративная дорисовывает новую вещь.

Откуда взялись генеративные модели: GAN, трансформеры, диффузия

Генеративные модели выросли из трёх архитектур: GAN (2014), трансформеры (2017) и диффузия, которая в 2022 году вывела генерацию картинок к массовому пользователю.

  • GAN, генеративно-состязательные сети. Их предложила в 2014 году группа исследователей во главе с Иэном Гудфеллоу. Две нейросети учатся в паре: генератор делает подделки, дискриминатор пытается отличить их от настоящих примеров. На GAN держались первые убедительные портреты несуществующих людей.
  • Трансформеры. Архитектуру описали исследователи Google в 2017 году в статье «Attention Is All You Need». На ней построены большие языковые модели (LLM): они предсказывают следующий фрагмент текста и так пишут ответы, письма, описания товаров.
  • Диффузионные модели. Учатся убирать шум из изображения шаг за шагом. Именно они в 2022 году сделали генерацию картинок по тексту публичной: тогда вышли DALL·E 2, Midjourney и Stable Diffusion. В конце того же года появился ChatGPT, и генеративный ИИ из лабораторий перешёл в повседневные сервисы.

Пользователю важнее не архитектура, а модальность — какой тип данных модель принимает и выдаёт. Текст в текст, текст в изображение, изображение плюс текст в изображение, фото в видео. Мультимодальные модели принимают несколько типов сразу, например снимок человека и фото вещи.

Как нейросеть создаёт изображение по фото и запросу

Если одной фразой: модель превращает случайный шум в картинку, которая соответствует условиям — тексту, исходному фото, маске области. У диффузионных моделей — на них построено большинство генераторов изображений — путь от обучения модели до готового кадра укладывается в четыре шага.

  1. Обучение. Модели показывают огромное количество изображений с подписями. К картинке подмешивают шум, а нейросеть учится предсказывать, какой шум добавили. Так она усваивает не сами снимки, а закономерности: как свет ложится на ткань, как складка на рукаве меняется при согнутом локте, чем фактура шерсти отличается от шёлка.
  2. Запрос. Вы задаёте условия: текстовый промт («портрет в студии, мягкий боковой свет»), своё фото, изображение вещи.
  3. Генерация. Модель стартует с шума и за серию шагов очищает его, каждый раз сверяясь с условиями. Сначала проступает силуэт, потом детали: пуговицы, швы, блики на коже.
  4. Точечная правка. Если нужно поменять только куртку, а лицо и фон оставить, генерацию ограничивают маской. Так работает инпейнтинг, на нём держится замена одежды на готовом снимке.

В примерке к этим условиям добавляется ещё одно — изображение конкретной вещи. Модель переносит фасон, цвет и принт на вашу фигуру и при этом сохраняет лицо, позу и свет исходника. Подробнее о самом подходе — в термине virtual try-on.

Практический вывод со съёмочной площадки: чем меньше модели приходится додумывать, тем точнее результат. Ровный свет без жёстких теней, открытое лицо, фигура целиком в кадре, если примеряете платье или брюки. Если ног на фото нет, нейросеть их нарисует — правдоподобно, но из воображения, а не по вашим пропорциям.

Где это работает в моде и e-commerce

Главная польза генеративного ИИ для стилиста и продавца — скорость проверки идеи. Раньше, чтобы увидеть вещь на человеке, её нужно было купить, привезти, надеть и сфотографировать. Теперь черновик образа появляется за минуты, а в примерочную и на съёмку идут уже отобранные варианты.

  • Примерка до покупки. Товар с маркетплейса можно показать на своём фото и понять, идёт ли вам цвет и как фасон работает с силуэтом. Пошагово, включая импорт вещи по ссылке, — в статье о том, как на Вайлдберриз примерить вещь по фото.
  • Замена одежды на готовом кадре. Удачный портрет с неудачной рубашкой больше не приговор снимку.
  • Фотосессия без студии. По одному фото модель собирает серию в разных стилях: деловой портрет, городская прогулка, вечерний образ. Как выглядят такие серии, можно посмотреть в разделе ИИ-фотосессия по одному фото.
  • Контент для карточек. Продавец снимает вещь, а генеративная модель показывает её на ИИ-моделях разной внешности — без аренды студии и кастинга под каждый артикул.

В работе стилиста я отношусь к генерации как к эскизу, а не к финалу. Она отвечает на вопрос «стоит ли это вообще примерять». Цвет у лица, длина относительно роста, баланс верха и низа — это на картинке видно. Плотность ткани, посадку в плечах и поведение вещи в движении картинка не покажет.

Ограничения и частые ошибки при работе с генерацией

Главное ограничение генеративного ИИ: модель правдоподобна, но не обязана быть точной. Она выдаёт наиболее вероятный вариант, а не проверенный факт.

  • Галлюцинации. Языковая модель уверенно ссылается на несуществующий стандарт или бренд. Модель изображений добавляет шестой палец, лишнюю пуговицу, разные серьги в ушах.
  • Принты, логотипы, надписи. Мелкий рисунок, текст на футболке, сложная клетка — зона риска: узор может поплыть или смениться похожим. Для карточки товара это критично, покупатель сравнит фото с тем, что пришло.
  • Размер и посадка. Примерка по фото показывает силуэт, пропорции и цвет, но не измеряет тело и не знает лекал. Размер выбирают по размерной сетке и своим замерам.
  • Цвет и фактура. Оттенок на генерации зависит от света исходника и настроек экрана. Пайетки, мех, тонкий трикотаж модель упрощает.
  • Чужие фото. Для примерки и фотосессий — только свои снимки или снимки людей, которые дали согласие. Изображение, выдающее себя за реальное фото конкретного человека, — это дипфейк, и к стилю он отношения не имеет.

Что помогает: смотреть результат в полном размере, сверять детали с оригиналом вещи, делать несколько вариантов и выбирать, а не публиковать первый. Для продавца правило простое: ИИ-фото показывает товар, но не улучшает его. Цвет, фурнитура и принт на кадре должны совпадать с реальной вещью.

Связанные понятия

  • Промт — текстовый запрос, которым задают генерацию: сюжет, свет, стиль, ракурс.
  • Диффузионная модель — архитектура, которая строит изображение из шума.
  • LLM, большая языковая модель — генеративная модель для текста.
  • Инпейнтинг — генерация внутри выделенной области снимка при сохранении остального кадра.
  • Virtual try-on — перенос вещи на фото человека.
  • Удаление фона — отделение человека или предмета от фона. Задача скорее распознающая, но в обработке фото часто стоит рядом с генерацией.

Генеративный ИИ полезен тому, кто понимает его природу: это быстрый черновик, который экономит съёмки и лишние заказы, а решение о вещи и кадре остаётся за человеком.

Также называют: генеративный искусственный интеллект, генеративная нейросеть, генеративные модели ИИ, generative AI, GenAI

Вопросы и ответы

Что такое генеративный искусственный интеллект простыми словами?

Генеративный искусственный интеллект — это программы, которые умеют создавать новое: писать текст, рисовать картинки, делать видео и звук по вашему описанию. Проще всего сравнить его с художником, который пересмотрел огромное количество работ и научился рисовать в любой манере, но не копирует конкретные полотна, а каждый раз пишет заново. Вы говорите «портрет в осеннем парке, тёплый свет», и модель собирает такой кадр из выученных закономерностей: как выглядит листва, как свет ложится на лицо, какие цвета дают ощущение осени. В быту это чат-боты, которые отвечают на вопросы, генераторы изображений, сервисы, которые оживляют фото или показывают одежду на вашем снимке. Общее у них одно: результат не выбирают из готового списка, а создают под запрос. Поэтому он всякий раз немного другой, и проверять его приходится глазами.

Как работает генеративный ИИ?

У любой генеративной модели две фазы. Первая — обучение: нейросеть прогоняют через огромный набор примеров, и она подстраивает внутренние параметры так, чтобы воспроизводить закономерности данных. Языковая модель учится угадывать следующий фрагмент текста, модель изображений учится восстанавливать картинку из шума. Вторая фаза — генерация по запросу. Вы даёте условие: вопрос, текстовое описание кадра, фото. Языковая модель пишет ответ по кусочку, каждый раз выбирая вероятное продолжение. Диффузионная модель начинает со случайного шума и за серию шагов превращает его в изображение, которое подходит под описание. В процесс заложена доля случайности, поэтому один и тот же запрос даёт разные варианты. Модель не хранит готовые ответы и не ищет их в интернете, если к ней специально не подключили поиск: она строит результат из того, что усвоила при обучении.

Чем генеративный ИИ отличается от обычного ИИ?

Генеративный ИИ — не отдельная наука, а часть искусственного интеллекта, и обе ветви обычно построены на нейросетях. Разница в задаче. Классическая, распознающая модель выбирает ответ из заранее известных вариантов: спам или не спам, платье или юбка, вырастет спрос или упадёт. Её легко проверить, потому что у задачи есть правильный ответ и процент попаданий. Генеративная модель создаёт то, чего раньше не было: письмо вместо пометки «спам», портрет вместо распознанного лица, вещь на человеке вместо найденной категории товара. Правильного ответа здесь нет, качество оценивают по правдоподобию и по тому, насколько результат соответствует запросу. В моде это хорошо видно на примере поиска по фото: найти похожие брюки в каталоге — работа распознающей модели, а показать эти брюки на вашем снимке — работа генеративной. На практике их часто соединяют в одной системе.

Что является примером генеративного ИИ?

Самые известные примеры — чат-боты на больших языковых моделях: ChatGPT, YandexGPT, GigaChat. Они пишут тексты, отвечают на вопросы, пересказывают документы. Второй большой класс — генераторы изображений: Midjourney, Stable Diffusion, Шедеврум. К этой же группе относится генеративная заливка в Photoshop, которая дорисовывает или заменяет часть снимка. Есть модели для видео, музыки, озвучки и программного кода. В моде и торговле генеративный ИИ — это примерка вещи на фото покупателя, замена одежды на готовом снимке, фотосессии по одному портрету, съёмка товара на ИИ-моделях, оживление фотографий. Если в тесте просят выбрать пример генеративного ИИ из списка, помогает простой критерий: система создаёт новый контент или выбирает из готового. Распознавание номера машины, фильтр спама и сортировка ленты — не генеративный ИИ, даже если там стоит нейросеть. Текст, картинка или видео, собранные под запрос, — генеративный.

Какие бывают генеративные нейросети?

Их удобно делить двумя способами. Первый — по типу результата. Текстовые модели пишут и редактируют текст, модели изображений создают и правят картинки, есть модели для видео, звука и речи, кода, трёхмерных объектов. Мультимодальные умеют принимать и выдавать несколько типов данных сразу, например понимают фото и отвечают текстом или берут снимок человека и изображение вещи и возвращают новое фото. Второй способ — по архитектуре. Генеративно-состязательные сети, GAN, устроены как пара соперников: генератор и дискриминатор. Вариационные автоэнкодеры сжимают данные в компактное описание и разворачивают обратно. Трансформеры лежат в основе языковых моделей. Диффузионные модели строят изображение из шума и широко применяются в генерации картинок. В реальных сервисах архитектуры часто комбинируют: одна часть понимает запрос, другая рисует, третья повышает разрешение.

Что такое модальность в контексте генеративного ИИ?

Модальность — это тип данных, с которым работает модель: текст, изображение, звук, видео. Одномодальная модель понимает один тип, например только текст, и выдаёт тоже текст. Мультимодальная принимает несколько сразу: вы загружаете фото и пишете вопрос, а модель отвечает с учётом обоих. От модальности зависит, какие задачи вообще можно поставить. Текст в изображение — генерация картинки по описанию. Изображение в изображение — правка или перерисовка снимка. Изображение в видео — оживление фотографии. Изображение плюс изображение в изображение — это как раз примерка: снимок человека и фото вещи на входе, новое фото на выходе. Практический смысл простой: чисто текстовая модель не видит вашу фотографию, сколько бы подробно вы её ни описывали. Для задач с внешностью и одеждой нужна модель, которая принимает изображение.

Что такое галлюцинации генеративного ИИ?

Галлюцинацией называют уверенный, но неверный результат. Модель не лжёт намеренно: она выдаёт самое вероятное продолжение, и иногда вероятное не совпадает с правдой. В тексте это выдуманные цифры, несуществующие книги и ссылки, чужие цитаты, приписанные не тому человеку. В изображениях — лишние пальцы, пуговицы не на своём месте, буквы, которые складываются в бессмыслицу, логотип, похожий на настоящий, но с ошибкой. Чем реже подобное встречалось в обучающих данных, тем выше риск. Снизить его можно: давать модели чёткий запрос и чистый исходник, делать несколько вариантов, проверять факты по первоисточникам, а детали на изображении — по оригиналу. Продавцу особенно важно сверять ИИ-фото с реальным товаром: придуманная строчка или чужой принт на кадре превращаются в претензию покупателя после получения посылки.

Какова роль человека при использовании генеративного ИИ?

Человек ставит задачу, выбирает исходники, оценивает результат и отвечает за то, что в итоге публикуется. Модель не знает контекста: для какого повода образ, какой дресс-код в офисе, удобно ли вам в этой вещи ходить весь день. У неё нет вкуса, есть только статистика того, что обычно встречается вместе. Поэтому стилист использует генерацию как быстрый эскиз, а решение принимает сам. Фотограф выбирает из серии кадры, где свет, поза и детали выглядят естественно, и отбраковывает неудачные. Продавец проверяет, что вещь на ИИ-фото совпадает с настоящей по цвету, фурнитуре и принту. Отдельная зона ответственности — этика: загружать можно только свои фото или снимки людей, которые на это согласились, и не выдавать сгенерированное изображение за реальную съёмку конкретного человека. Чем лучше человек понимает ограничения модели, тем полезнее результат.