Такие релизы я разбираю регулярно - как потенциальное изменение в архитектуре того, что уже собрано, а не как новость ради новости. Похожие разборы - в канале Клиенты in Forbes.

Что вообще изменилось в этом релизе

Коротко: OpenAI подняли качество генерации и, судя по описанию к релизу, сместили фокус на более точное соответствие запросу - но что именно стало точнее, в описании не расшифровано.

Здесь я намеренно не достраиваю то, чего нет в описании. Точность может относиться к тексту на изображении, к соблюдению композиции, к согласованности объекта при редактировании поверх готовой картинки - и каждый из этих вариантов проверяется своим способом. Какой из них имели в виду в OpenAI, остаётся открытым вопросом, и гадать я не буду. Деталей я не знаю - это честнее, чем выдать догадку за факт и потом проверять модель не на том, что реально изменилось.

Что я знаю точно и что важно для меня как для человека, у которого генерация картинок стоит внутри нескольких продуктов: вышла именно новая версия модели, а не отдельный новый продукт. Значит, разбираться нужно через сравнение с тем, что уже стояло у меня раньше.

Где у меня уже стоит генерация картинок

Коротко: в двух местах с разной логикой - как вспомогательный инструмент внутри рабочего конвейера и как основной продукт в отдельном сервисе.

Первое место - Ganimar Content Factory. Ночью конвейер обходит источники, проверяет факты, выбирает тему дня и пишет пост для Telegram. Утром я его читаю и прохожу через гейт публикации. Обложка к посту - расходный элемент этого конвейера: она не несёт фактов, которые нужно проверять построчно, но должна быть узнаваемой и не портить впечатление от текста. Про то, как устроена эта система в целом, я писал отдельно - Контент-завод на Claude: система, а не демо на 20 минут.

Второе место - aimagenarium, SaaS-платформа AI-генерации изображений с монетизацией через внутренние кредиты. Здесь генерация картинок - это весь продукт, а не вспомогательная функция вокруг чего-то другого.

Это разные роли одной технологии. В одном случае модель - деталь конвейера, и её задача - не подвести на потоке. В другом случае она продаётся пользователю напрямую через кредиты, и её задача - оправдывать цену. Проверка релиза ChatGPT Images 2.5 для этих двух ролей идёт по-разному, и дальше я разберу, как именно.

Если вы тоже держите генерацию контента внутри продукта и хотите свериться, как это устроено у рабочей системы - витрина кейсов собрана для такой сверки.

Первое, что я делаю после релиза новой модели

Коротко: сначала прогоняю несколько своих типовых промптов рядом со старой версией и сравниваю результат вручную, и только потом решаю, переключать продукт или нет.

Этот прогон - фильтр, а не финальная проверка. Если новая версия явно хуже старой на привычных задачах - модель откладывается, и дальше по чек-листу идти не имеет смысла. Если результат не хуже или лучше - переходим к серьёзной проверке, потому что одна удачная картинка ещё ничего не доказывает.

Что я проверяю в новой модели в первую очередь

Коротко: не то, стало ли красивее, а пять конкретных вещей, которые ломают продукт, если их пропустить.

  1. Соответствие промпту на серии, а не на одной картинке. Одна удачная генерация ничего не доказывает - нужна серия из повторяющих один и тот же запрос попыток, чтобы увидеть, насколько стабилен результат.
  2. Как модель держит текст на изображении. Для обложек и карточек текст в кадре - частый элемент, и его нужно проверять отдельно от общего качества картинки: читается ли, не съезжает ли, не превращается ли в набор случайных символов.
  3. Согласованность объекта при редактировании. Когда модель правит уже готовое изображение по инструкции, важно, остаётся ли узнаваемым то, что не должно было меняться.
  4. Поведение при пакетной генерации. Контент-конвейеру нужна стабильная серия картинок подряд, а не одна удачная попытка - смотрю, не деградирует ли качество и скорость на серии подряд идущих запросов.
  5. Поведение на промптах из очереди, а не на придуманных примерах. Финальную проверку гоняю на запросах, которые система реально формирует для сегодняшнего поста, а не на аккуратных тестовых формулировках.

Что нельзя проверить на глаз

Коротко: визуальное качество видно сразу, а стабильность и поведение на объёме одним взглядом не оценить - для этого нужна серия прогонов и время.

Красивая картинка на первом промпте - это одна точка данных, и она ничего не говорит о том, воспроизводится ли результат. Чтобы это понять, нужно прогнать один и тот же сценарий много раз и посмотреть на разброс между попытками.

Отдельно стоит поведение модели на граничных промптах: сложная композиция, несколько объектов в кадре, инструкция на редактирование, которая частично противоречит сама себе. Такие случаи почти никогда не входят в первую проверку по принципу нравится или нет, и именно они всплывают в проде через какое-то время после того, как модель уже встроена и работает без присмотра.

Разная экономика: конвейер и продукт, который продаёт генерацию

Коротко: в конвейере генерация - это расход, который почти не чувствуется на общем фоне; в продукте, который продаёт генерацию напрямую, любое изменение условий доступа к модели считается отдельно.

В Ganimar Content Factory генерация обложек - маленькая часть общих расходов на работу системы. Если у модели изменится стоимость или условия доступа, для конвейера это почти незаметно на фоне остальных задач, которые он решает.

В aimagenarium ситуация другая. Там генерация - это то, что покупает пользователь через внутренние кредиты, и стоимость доступа к модели напрямую влияет на то, сходится ли экономика этих кредитов. Что именно поменялось в условиях доступа к API у новой версии модели, я здесь утверждать не буду - я это не проверял, и в описании релиза таких деталей нет. Но это ровно то, что я выясню первым делом, прежде чем переводить продукт с платной монетизацией на новую версию: расчёт себестоимости на реальном объёме генераций пользователей, а не тестовые картинки.

Что я делаю, если модель не проходит проверку

Коротко: фиксирую, на каком именно пункте чек-листа она споткнулась, и оставляю старую версию рабочей до следующего релиза.

Провал на одном из пяти пунктов - это конкретная причина, которую можно записать: не держит текст, деградирует на серии, ломает объект при редактировании. Это же становится тем, что я перепроверяю первым при следующем релизе модели - список пунктов растёт, а не обновляется с нуля каждый раз.

Грабли: когда проверка кажется пройденной, а на самом деле нет

Коротко: самая частая ошибка - остановиться после первой удачной серии тестов и не проверить модель на промптах, которые реально идут в проде.

Тестовые промпты почти всегда чище боевых: короче, без противоречивых требований, без редактирования поверх редактирования. Модель, которая уверенно прошла несколько аккуратных тестов, может споткнуться на первом же реальном запросе из очереди конвейера.

Ещё одна ловушка - решить, что раз визуальное качество выросло, значит и остальное подтянулось само. Рост качества картинки и стабильность на объёме - разные вещи, и одно не гарантирует другого.

Разбор с той же логикой - без домыслов о том, чего нет в описании релиза, и с проверкой на реальных, а не тепличных промптах - я делал и раньше на другом материале: Система искусственного интеллекта для чайников: разбор завода.

Дальше шаг простой: открыть витрину кейсов и посмотреть, как эта же логика проверки и внедрения моделей выглядит на других моих разработках.