Такие релизы я разбираю регулярно - как потенциальное изменение в архитектуре того, что уже собрано, а не как новость ради новости. Похожие разборы - в канале Клиенты in Forbes.
Что вообще изменилось в этом релизе
Коротко: OpenAI подняли качество генерации и, судя по описанию к релизу, сместили фокус на более точное соответствие запросу - но что именно стало точнее, в описании не расшифровано.
Здесь я намеренно не достраиваю то, чего нет в описании. Точность может относиться к тексту на изображении, к соблюдению композиции, к согласованности объекта при редактировании поверх готовой картинки - и каждый из этих вариантов проверяется своим способом. Какой из них имели в виду в OpenAI, остаётся открытым вопросом, и гадать я не буду. Деталей я не знаю - это честнее, чем выдать догадку за факт и потом проверять модель не на том, что реально изменилось.
Что я знаю точно и что важно для меня как для человека, у которого генерация картинок стоит внутри нескольких продуктов: вышла именно новая версия модели, а не отдельный новый продукт. Значит, разбираться нужно через сравнение с тем, что уже стояло у меня раньше.
Где у меня уже стоит генерация картинок
Коротко: в двух местах с разной логикой - как вспомогательный инструмент внутри рабочего конвейера и как основной продукт в отдельном сервисе.
Первое место - Ganimar Content Factory. Ночью конвейер обходит источники, проверяет факты, выбирает тему дня и пишет пост для Telegram. Утром я его читаю и прохожу через гейт публикации. Обложка к посту - расходный элемент этого конвейера: она не несёт фактов, которые нужно проверять построчно, но должна быть узнаваемой и не портить впечатление от текста. Про то, как устроена эта система в целом, я писал отдельно - Контент-завод на Claude: система, а не демо на 20 минут.
Второе место - aimagenarium, SaaS-платформа AI-генерации изображений с монетизацией через внутренние кредиты. Здесь генерация картинок - это весь продукт, а не вспомогательная функция вокруг чего-то другого.
Это разные роли одной технологии. В одном случае модель - деталь конвейера, и её задача - не подвести на потоке. В другом случае она продаётся пользователю напрямую через кредиты, и её задача - оправдывать цену. Проверка релиза ChatGPT Images 2.5 для этих двух ролей идёт по-разному, и дальше я разберу, как именно.
Если вы тоже держите генерацию контента внутри продукта и хотите свериться, как это устроено у рабочей системы - витрина кейсов собрана для такой сверки.
Первое, что я делаю после релиза новой модели
Коротко: сначала прогоняю несколько своих типовых промптов рядом со старой версией и сравниваю результат вручную, и только потом решаю, переключать продукт или нет.
Этот прогон - фильтр, а не финальная проверка. Если новая версия явно хуже старой на привычных задачах - модель откладывается, и дальше по чек-листу идти не имеет смысла. Если результат не хуже или лучше - переходим к серьёзной проверке, потому что одна удачная картинка ещё ничего не доказывает.
Что я проверяю в новой модели в первую очередь
Коротко: не то, стало ли красивее, а пять конкретных вещей, которые ломают продукт, если их пропустить.
- Соответствие промпту на серии, а не на одной картинке. Одна удачная генерация ничего не доказывает - нужна серия из повторяющих один и тот же запрос попыток, чтобы увидеть, насколько стабилен результат.
- Как модель держит текст на изображении. Для обложек и карточек текст в кадре - частый элемент, и его нужно проверять отдельно от общего качества картинки: читается ли, не съезжает ли, не превращается ли в набор случайных символов.
- Согласованность объекта при редактировании. Когда модель правит уже готовое изображение по инструкции, важно, остаётся ли узнаваемым то, что не должно было меняться.
- Поведение при пакетной генерации. Контент-конвейеру нужна стабильная серия картинок подряд, а не одна удачная попытка - смотрю, не деградирует ли качество и скорость на серии подряд идущих запросов.
- Поведение на промптах из очереди, а не на придуманных примерах. Финальную проверку гоняю на запросах, которые система реально формирует для сегодняшнего поста, а не на аккуратных тестовых формулировках.
Что нельзя проверить на глаз
Коротко: визуальное качество видно сразу, а стабильность и поведение на объёме одним взглядом не оценить - для этого нужна серия прогонов и время.
Красивая картинка на первом промпте - это одна точка данных, и она ничего не говорит о том, воспроизводится ли результат. Чтобы это понять, нужно прогнать один и тот же сценарий много раз и посмотреть на разброс между попытками.
Отдельно стоит поведение модели на граничных промптах: сложная композиция, несколько объектов в кадре, инструкция на редактирование, которая частично противоречит сама себе. Такие случаи почти никогда не входят в первую проверку по принципу нравится или нет, и именно они всплывают в проде через какое-то время после того, как модель уже встроена и работает без присмотра.
Разная экономика: конвейер и продукт, который продаёт генерацию
Коротко: в конвейере генерация - это расход, который почти не чувствуется на общем фоне; в продукте, который продаёт генерацию напрямую, любое изменение условий доступа к модели считается отдельно.
В Ganimar Content Factory генерация обложек - маленькая часть общих расходов на работу системы. Если у модели изменится стоимость или условия доступа, для конвейера это почти незаметно на фоне остальных задач, которые он решает.
В aimagenarium ситуация другая. Там генерация - это то, что покупает пользователь через внутренние кредиты, и стоимость доступа к модели напрямую влияет на то, сходится ли экономика этих кредитов. Что именно поменялось в условиях доступа к API у новой версии модели, я здесь утверждать не буду - я это не проверял, и в описании релиза таких деталей нет. Но это ровно то, что я выясню первым делом, прежде чем переводить продукт с платной монетизацией на новую версию: расчёт себестоимости на реальном объёме генераций пользователей, а не тестовые картинки.
Что я делаю, если модель не проходит проверку
Коротко: фиксирую, на каком именно пункте чек-листа она споткнулась, и оставляю старую версию рабочей до следующего релиза.
Провал на одном из пяти пунктов - это конкретная причина, которую можно записать: не держит текст, деградирует на серии, ломает объект при редактировании. Это же становится тем, что я перепроверяю первым при следующем релизе модели - список пунктов растёт, а не обновляется с нуля каждый раз.
Грабли: когда проверка кажется пройденной, а на самом деле нет
Коротко: самая частая ошибка - остановиться после первой удачной серии тестов и не проверить модель на промптах, которые реально идут в проде.
Тестовые промпты почти всегда чище боевых: короче, без противоречивых требований, без редактирования поверх редактирования. Модель, которая уверенно прошла несколько аккуратных тестов, может споткнуться на первом же реальном запросе из очереди конвейера.
Ещё одна ловушка - решить, что раз визуальное качество выросло, значит и остальное подтянулось само. Рост качества картинки и стабильность на объёме - разные вещи, и одно не гарантирует другого.
Разбор с той же логикой - без домыслов о том, чего нет в описании релиза, и с проверкой на реальных, а не тепличных промптах - я делал и раньше на другом материале: Система искусственного интеллекта для чайников: разбор завода.
Дальше шаг простой: открыть витрину кейсов и посмотреть, как эта же логика проверки и внедрения моделей выглядит на других моих разработках.
