grok-imagine-video-1.5 分辨率更高、能用预设音色;
而 grok-imagine-video 是唯一接受视频作为输入的,编辑和延长都要靠它。
用哪个取决于你是要造一段片子,还是要改一段现成的。
系列总览
向一个模型要它做不到的事,会在提交时就被拒、不会入队,而且消息会告诉你该换哪个:
三种模式
input.mode 决定模型做什么,取 generate、edit 或 extend,默认 generate。
edit 按提示词改写一段现成的片子并保持长度,所以它不接受 resolution——
输出跟随源片。extend 是在末尾接一段新画面。
duration: 3,产出 6.04 秒——原片加三秒延长段,
不是重新渲染。
参数
下面这些都放在input 里。信封见异步任务 API。
没有
n——视频模型每个任务只产一段。
和图像模型不同,视频没有
auto 画幅,也没有超宽比例。上面七个就是全部。分辨率与时长
实测输出像素,每档一个样本:1080p 在 grok-imagine-video 上会被拒:
1080p is only available on grok-imagine-video-1.5。
产物比请求的时长多约 0.04 秒——要 3 秒,文件是 3.04 秒。
每个样本都是这样,且不影响计费,计费按请求的时长算。
参考图、首帧与音色
能喂进去的有三样东西,其中两样互斥:images是首帧。恰好一张,片子从这一帧往后动。reference_images是风格与主体参考,最多三张。两个模型都接受, 而且一旦用了,输出封顶720p——reference_images配1080p会被拒:reference images are capped at 720p。- 两个同时给会被拒:
cannot be combined with images; a first frame and reference images are different modes。
voice_ids 在 grok-imagine-video-1.5 上选预设音色,每段最多三个。合法取值:
WideRouter 上没有自定义音色。注意音色 ID 本身不在提交时校验——写错的名字会被
接受,然后任务失败。音色和
generate_audio: false 都不改变价格。
计价
这几个模型走Grok-Official 分组。WideRouter 的标价与 xAI 官方价完全一致——
折扣体现在分组倍率上,Grok-Official 的倍率是 0.8。所以实际扣费是:
有三条规则是光看每秒单价看不出来的:
- 你送进去的媒体也要收费。 一张参考图约 $0.01;
edit与extend的源片 按它自己的长度算,每秒约 $0.01。 extend不对原片重复收费。 只有新增的那一段按每秒单价计,再加源片作为输入。 实测:把一段 3.04 秒的片子延长 3 秒花了 $0.18——三秒输出按 $0.05 加上 3.04 秒输入按 $0.01——而结果是 6.04 秒。从头生成六秒要 $0.30。edit大约按源片长度收两遍,一遍算输出一遍算输入。 实测:编辑一段 1.04 秒的片子花了 $0.06。
grok-imagine-video 出三秒 480p:
完成的任务里带一个
usage.cost_in_usd_ticks 字段,10000000000 ticks 等于 $1。
这个数字是原价,还没乘分组倍率。乘上你所在分组的倍率,才是实际从余额里扣掉的数。时延
异步接口上从提交到completed 的端到端实测:
比人们常说的「视频模型通常要几分钟」快得多,但仍然慢到不能挂连接等——
这正是它没有同步端点的原因。每两三秒轮询一次,客户端超时按这张表最慢的那一行设,
不要按最快的设。
任务失败时
视频的失败是一个failed 状态的任务加一个 error 对象,不是 HTTP 错误——
查询端点仍然返回 200。常见的 code 是 upstream_error,消息由 xAI 原样透传:
下一步
Playground
在浏览器里真实提交一个视频任务并轮询到完成。
Grok Imagine 图片
这个系列的图像那一半——三个变体与质量档位。