← Назад к списку

Модели генерации изображений на Replicate для рекламной инфографики Авито (русский текст)

7 сентября 2026 · research/2026-09-07-image-models-for-avito.md

Модели генерации изображений на Replicate для рекламной инфографики Авито (русский текст)

Дата: 2026-09-07. Исполнитель: Гриша. Задача: разведка моделей на Replicate для карточек Авито с русским текстом в стиле референсов data/references/ad-cards/ref-*.jpg (вертикаль 3:4, фото продукта + типографские плашки с кириллицей: заголовок, колауты-выгоды со значениями «ДИАМЕТР НОЖКИ 22 мм», «ТОЛЩИНА СТЕНКИ 1.2 мм»).

Метод: официальный API Replicate (схемы входов, счётчики запусков, время генерации из default_example) + публичные страницы моделей и прайс-сравнения. Без генераций — только ресёрч. Проверено на живых схемах через API 2026-09-07.

Сравнительная таблица

Модель (Replicate)Текст/кириллицаИнфографика/лейаутImage input (референс)Цена за генерациюСкорость*Примечание
google/nano-banana-2Отлично; лидер по рендеру текста, мультиязычность включая нелатиницуСильная: следует сложным композиционным инструкциям**Да: image_input, до 14 изображений** + aspect_ratio: match_input_image + гrounding через Google Image/Web Search$0.067 (1K) / $0.101 (2K) / $0.151 (4K)~25 с18,4 млн запусков; наш приоритет — оправдан
ideogram-ai/ideogram-v3-turboЛучшая в классе типографика, мультиязычный текст (кириллица — профильная сила)Постеры/плакаты/лейауты — основной юзкейс моделиДа: image — до 3 референсов стиля (style reference)$0.03 — самый дешёвый из кандидатов~6 с9,5 млн запусков. Базовый ideogram-v3 на Replicate отсутствует, есть варианты -turbo ($0.03) и -quality ($0.09)
bytedance/seedream-4Хорошо (сильна в мультиязычии из коробки ByteDance)Сильная: «knowledge-driven» — схемы, диаграммы, подписанные сцены, 4KДа: multi-reference (в описании модели), схема на Replicate принимает референсы~$0.03–0.04~14 с39 млн запусков; генерация+редактирование в одной модели
black-forest-labs/flux-1.1-proСлабо — текст роняет, кириллицу искажает (классическая боль Flux)Хорошее фото, но лейаут с текстом — не егоЧастично: image_prompt (Flux Redux) — только композиционное руководство, не редактирование$0.04~4 с72 млн запусков; для карточек с текстом не подходит
black-forest-labs/flux-kontext-proСредне; у kontext-max «improved typography generation»Редактирование: замена текста на вывесках/постерах, стайл-трансфер**Да: input_image** — это его основной режим$0.04 (pro) / $0.08 (max)~4–5 сДля правок готовой карточки («замени 22 мм на 25 мм»), не для генерации с нуля

\* медианное время из default_example.metrics страницы модели.

Ключевые проверки

nano-banana-2 принимает image input — подтверждено по живой схеме API. Поле image_input: array — «Input images to transform or use as reference (supports up to 14 images)». По умолчанию aspect_ratio: match_input_image — отдаёшь референс ref-5555.jpg, получаешь картинку в его пропорциях и стиле. Плюс флаги image_search и google_search (графический и веб-графаундинг). Обязательные поля: только prompt. Это закрывает приём «сделай как этот пример».

Ideogram v3: типографика — заявленный профиль модели («precise text generation for graphic design, complex and lengthy text compositions»), мультиязычность подтверждена независимыми обзорами (кириллица — рекомендуемый кейс). 3 style-референса на запрос. Turbo — 6 секунд и $0.03, quality — $0.09 для финальных версий.

Seedream 4: заявлена генерация «charts, timelines, annotated scenes» — то есть инфографика в терминах вендора; multi-reference и редактирование промтом («replace X with Y») в одной модели.

Flux 1.1 pro: текста боится. Для Авито-карточек с надписями — исключён, остаётся только для фонов/стоковых фото без текста. Flux kontext: инструмент правки готовых изображений (в т.ч. замена текста кавычками «replace 'old' with 'new'»), max-версия лучше печатает.

Рекомендация: какую модель для каких задач

  1. Карточки Авито с русским текстом — основной поток: nano-banana-2. Причины: лучший рендер текста среди кандидатов, до 14 референсов стиля (отдаём 2–3 примера из data/references/ad-cards/), match_input_image держит вертикаль 3:4 референсов, уверенно следует лейаут-инструкциям («заголовок сверху, два колаута: зелёная плашка + белое значение»). Рабочая связка: draft — 1K ($0.067), финал — 2K ($0.101; референсы 1320×1758, 2K покрывает).
  2. Быстрые черновики и массовые варианты: ideogram-v3-turbo. $0.03 и 6 секунд — в 4 раза дешевле nano-banana-2; типографика лучшая в классе, 3 стиле-референса. Использовать для генерации 4–6 вариантов лейаута, лучший — дорабатывать в nano-banana-2. Для публикационного качества — ideogram-v3-quality ($0.09).
  3. Стиль по референсу без перегенерации текста: seedream-4 — запасной игрок: если nano-banana-2 споткнётся о конкретный лейаут, seedream сильна именно в инфографике и принимает мульти-референсы.
  4. Фоны и сток без текста: flux-1.1-pro ($0.04, 4 с) — быстро и дёшево там, где надписи не нужны.
  5. Правки готовой карточки: flux-kontext-pro/max — замена цен/значений и текста на существующей картинке («replace '22 мм' with '25 мм'»), max ($0.08) — если текст критичен.

Топ-2 кандидата

  1. nano-banana-2 — единственная закрывает полный цикл карточки: кириллица + референс стиля + 3:4 + лейаут. Приоритет Виктора подтверждён фактами.
  2. ideogram-v3-turbo — лучшая типографика за $0.03/6 с; идеален как дешёвый генератор вариантов и как fallback.

Слепые зоны (проверить генерациями, не ресёрчем)

Источники: API Replicate (схемы моделей, 2026-09-07); replicate.com/google/nano-banana-2, replicate.com/ideogram-ai/ideogram-v3-turbo, replicate.com/bytedance/seedream-4, replicate.com/black-forest-labs/flux-kontext-pro; прайс: UD Blockchain (2026-08-03), fluxapi.ai, scopeful.org, modelslab.com (июль 2026); качество текста: Phygital+ Ideogram 3 catalog, ropewalk.ai (2026-09-06), NeuroPrompts (кириллица в Ideogram).