Skip to main content
Grok Imagine — это семейство моделей генеративных медиа от xAI. Три из них создают изображения, и все три работают через API асинхронных задач с тем же форматом оболочки, что и все остальные модели на платформе. Идентификаторы моделей в точности соответствуют официальным названиям xAI. WideRouter не публикует псевдонимы.

Краткий обзор серии

Все три принимают одни и те же параметры, за одним исключением: только grok-imagine-image-2.0 принимает quality. В двух других моделях он отклоняется как unknown field, поскольку их качество фиксировано, а не выбирается. Именно на этом основан выбор между ними:
  • grok-imagine-image-2.0 — настраиваемая модель. Используйте её, когда нужно найти компромисс между стоимостью и точностью или требуется определённое соотношение сторон и разрешение.
  • grok-imagine-image-quality имеет фиксированное высокое качество и по умолчанию использует книжную ориентацию. Используйте её, когда качество важнее контроля.
  • grok-imagine-image значительно дешевле двух других моделей. Используйте её для черновиков, миниатюр и любых материалов, которые нужно генерировать массово.

Параметры

Оболочка содержит те же три ключа, описанные в API асинхронных задач, — model, input и необязательный callback_url. Всё ниже указывается внутри input. Проверка внутри input выполняется строго: нераспознанный ключ немедленно отклоняется с invalid_params и param, в котором он указывается точно. Опечатка приводит к явной ошибке, а не незаметно игнорируется.
Значения resolution указаны в нижнем регистре (1k, 2k). Это противоположно серии Nano Banana, в которой в image_size используются 1K / 2K / 4K в верхнем регистре. У этих двух семейств здесь разные имена параметров, поэтому переносить нечего — используйте эту таблицу, а не ту.

Разрешение и качество

В grok-imagine-image-2.0 эти два измерения независимы, и оба влияют на результат. Измеренные размеры в пикселях, по одному примеру каждого: Для двух других моделей применяется только resolution. Измеренный результат: grok-imagine-image при 2k возвращает 2816 × 1584; grok-imagine-image-quality при 2k возвращает 1776 × 2368. Точные размеры в пикселях определяет модель, это не фиксированная сетка — один и тот же уровень даёт разные значения в зависимости от запрошенного соотношения сторон. Рассматривайте таблицу как порядок величины, а фактический размер смотрите в файле.

Соотношения сторон

Все три модели поддерживают одинаковые 16 значений: Если не указывать это значение, каждая модель использует собственное соотношение сторон по умолчанию — альбомную ориентацию для grok-imagine-image и grok-imagine-image-2.0, книжную ориентацию для grok-imagine-image-quality. auto позволяет модели выбрать соотношение сторон на основе промпта.

Эталонные изображения

Передайте до трёх изображений в input.images, чтобы отредактировать их или создать композицию на их основе. Каждая запись представляет собой URL https или URI данных в формате base64:
Четвёртое изображение отклоняется во время отправки: input.imagesmust contain at most 3 items. Некорректная запись содержит свой индекс: input.images[0]must be an https URL or a base64 image data URI. WideRouter получает URL на стороне сервера, поэтому они должны быть доступны из общедоступного интернета. Если имя хоста не разрешается или хост возвращает данные, которые не являются изображением, задача завершается с ошибкой после постановки в очередь, а не во время отправки.

Цены

Эти модели предоставляются через группу Grok-Official. Прейскурантная цена WideRouter в точности совпадает с официальной ценой xAI — скидка отражается в коэффициенте тарифа группы, который для Grok-Official составляет 0.8. Поэтому вы платите:
Прейскурантные цены за одно изображение, подтверждённые по значениям тарификации, которые возвращает API: Два правила, которые легко упустить:
  • Эталонные изображения оплачиваются дополнительно — около $0.01 за каждое входное изображение сверх цены вывода. Композиция из трёх изображений тарифицируется как один вывод плюс три входных изображения.
  • n умножается. Четыре изображения с параметрами 2k / medium стоят в четыре раза дороже одного изображения, а не тарифицируются по оптовой ставке.
За выполненную задачу начисляется usage.cost_in_usd_ticks, где 10000000000 тиков равны $1. Это прейскурантная цена — до применения коэффициента тарифа вашей группы. Умножьте её на тариф вашей группы, чтобы получить фактическую сумму, списываемую с вашего баланса.

Задержка

Измерено от начала до конца в асинхронном API: от отправки до completed, по одному образцу для настроек по умолчанию: Эти показатели достаточно высоки, поэтому асинхронный цикл — отправка запроса с последующей проверкой каждые две-три секунды — часто занимает больше времени по часам, чем сама генерация. Обычно результатом становятся две проверки.

Синхронный интерфейс

Все три модели также отвечают через POST /v1/images/generations, который удерживает соединение открытым и возвращает изображение напрямую.
Ответ содержит data и usage. Содержимое data[0] зависит от response_format: b64_json — байты inline, url — ссылку.
При использовании response_format: "url" ссылка указывает на собственный хост xAI, а не на CDN WideRouter, и мы не можем гарантировать срок её действия. При измерении: генерация 2k вернула файл PNG размером 5,2 МБ через imgen.x.ai, тогда как та же модель в асинхронном API возвращает JPEG через CDN WideRouter с документированным сроком действия 24 часа. В этом случае предпочтительно использовать b64_json или асинхронный API.
Синхронный путь проще для скрипта, которому нужно немедленно получить байты, но он удерживает соединение на протяжении всей генерации — при измерении это заняло 19,4 секунды через 2k. Для всего, что работает за бессерверной функцией, обратным прокси или в мобильном клиенте, следует использовать асинхронный API.

Следующие шаги

Песочница

Отправьте реальный запрос из браузера и дождитесь завершения задачи.

Видео Grok Imagine

Видео-часть семейства — создавайте, редактируйте и расширяйте клипы.