grok-imagine-video-1.5 генерирует видео
в более высоком разрешении и может использовать предустановленные голоса; grok-imagine-video —
единственная модель, которая принимает видео в качестве входных данных, что необходимо
для редактирования и расширения видео. Выбор зависит от того, создаёте ли вы клип или изменяете его.
Серия: краткий обзор
Запрос функции, которую модель не поддерживает, завершается ошибкой при отправке — до постановки в очередь. В сообщении указывается, какую модель следует использовать вместо неё:
Режимы
input.mode выбирает действие модели. Он принимает generate, edit или
extend, а по умолчанию используется generate.
edit переписывает существующий клип по prompt и сохраняет его длительность, поэтому не
принимает resolution — результат соответствует исходнику. extend добавляет новые
кадры в конец.
duration: 3 создал 6,04-секундный
клип — исходник плюс трёхсекундное расширение, а не повторный рендеринг.
Параметры
Все перечисленное ниже помещается внутрьinput. Конверт описан в
API асинхронных задач.
Параметра
n не существует — видеомодели создают один клип на задачу.
В отличие от моделей для изображений, для видео нет соотношения сторон
auto и сверхшироких
соотношений сторон. Семь приведенных выше значений составляют полный список.Разрешение и длительность
Измеряемые выходные пиксели, по одному примеру для каждого уровня:1080p отклоняется на grok-imagine-video с сообщением
1080p is only available on grok-imagine-video-1.5.
Длительность клипов примерно на 0,04 секунды больше запрошенной — запросите 3 секунды,
и файл будет длительностью 3,04 секунды. Это неизменно для каждого примера и не
влияет на тарификацию: она рассчитывается исходя из запрошенной длительности.
Эталонные изображения, первые кадры и голоса
Можно передать три разных типа данных, причём два из них взаимоисключающие:images— это первый кадр. Ровно одно изображение, и клип анимируется, начиная с него.reference_imagesзадаёт стиль и объект, допускается до трёх изображений. Обе модели принимают этот параметр, но его использование ограничивает результат значением720p— сочетаниеreference_imagesс1080pотклоняется с ошибкойreference images are capped at 720p.- Передача обоих параметров отклоняется:
cannot be combined with images; a first frame and reference images are different modes.
voice_ids выбирает предустановленные голоса в grok-imagine-video-1.5 — до трёх на клип. Допустимые значения:
Пользовательские голоса недоступны в WideRouter. Обратите внимание: сам идентификатор голоса не проверяется во время отправки — неизвестное имя принимается, после чего задача завершается с ошибкой. Ни голоса, ни
generate_audio: false не изменяют стоимость.
Тарификация
Эти модели обслуживаются через группуGrok-Official. Прайсовая
цена WideRouter в точности соответствует официальной цене xAI — скидка действует через коэффициент тарифа
группы, который составляет 0.8 для Grok-Official. Таким образом, вы платите:
Три правила, которые не отражает одна лишь посекундная ставка:
- Отправленные вами медиафайлы также тарифицируются. Эталонное изображение добавляет примерно $0.01;
исходный клип для
editилиextendтарифицируется за секунду собственной длительности — около $0.01 за секунду. extendне тарифицирует исходный материал повторно. По посекундной ставке оплачивается только новый сегмент, плюс исходный клип как входные данные. Измерено: продление 3.04-секундного клипа на 3 секунды стоило $0.18 — три секунды результата по $0.05 плюс 3.04 секунды входных данных по $0.01 — при итоговой длительности 6.04 секунды. Повторная генерация шести секунд с нуля обошлась бы в $0.30.editстоит примерно вдвое больше длительности исходника, один раз как результат и один раз как входные данные. Измерено: редактирование 1.04-секундного клипа стоило $0.06.
480p на grok-imagine-video:
У выполненной задачи указано
usage.cost_in_usd_ticks, где 10000000000
единиц соответствует $1. Это значение является прайсовой ценой — до применения коэффициента вашей группы.
Умножьте его на ставку вашей группы, чтобы узнать сумму, которая фактически списывается с вашего баланса.Задержка
Измерено от начала до конца в асинхронном API, от отправки доcompleted:
Генерация происходит значительно быстрее, чем «обычно несколько минут», которые часто указывают для моделей генерации видео, но всё же занимает достаточно много времени, чтобы удерживать соединение открытым было нельзя — поэтому синхронного эндпоинта нет. Выполняйте опрос каждые две–три секунды и задавайте тайм-аут клиента исходя из самой медленной строки в этой таблице, а не из самой быстрой.
Если задача завершается с ошибкой
Ошибки видео возвращаются как задачаfailed с объектом error, а не как ошибка HTTP — эндпоинт чтения по-прежнему возвращает 200. Распространённый код — upstream_error, а сообщение передаётся напрямую от xAI:
Следующие шаги
Среда тестирования
Отправьте реальную задачу на генерацию видео из браузера и отслеживайте её выполнение до завершения.
Изображение Grok Imagine
Графическая часть семейства — три варианта и сетка качества.