系列总览
三个模型的参数面只差一个字段:只有
grok-imagine-image-2.0 认 quality,
另外两个会返回 unknown field——它们的质量是固定的,不给你调。
选型就看这一点:
grok-imagine-image-2.0是可调的那个。需要在成本和画质之间权衡, 或者需要指定画幅与分辨率时用它。grok-imagine-image-quality质量固定在高档,默认出竖图。 画质比控制力更重要时用它。grok-imagine-image比另两个便宜一大截。草稿、缩略图、需要批量生成的场景用它。
参数
信封就是异步任务 API 里说的那三个键——model、input
和可选的 callback_url。下面这些都放在 input 里。
input 内部是严格白名单校验——不认识的键直接以 invalid_params 拒绝,
param 精确指出是哪个。拼错字段名会立刻报错,不会被静默丢掉。
分辨率与质量
在grok-imagine-image-2.0 上这是两个独立维度,都会改变输出。实测像素,每档一个样本:
另外两个模型只有
resolution 起作用。实测:grok-imagine-image 在 2k 下出
2816 × 1584,grok-imagine-image-quality 在 2k 下出 1776 × 2368。
具体像素是模型自己定的,不是一张固定网格——同一个档位在不同画幅下落在不同数字上。
把这张表当量级看,真实尺寸从文件里读。
画幅比例
三个模型接受同一组 16 个取值:
不传则各模型用自己的默认画幅——
grok-imagine-image 与 grok-imagine-image-2.0
出横图,grok-imagine-image-quality 出竖图。auto 让模型自己从提示词里判断。
参考图
在input.images 里最多放三张图,用来编辑或合成。每一项是 https URL 或
base64 data URI:
input.images — must contain at most 3 items。
格式不对的那一项会带上下标:input.images[0] —
must be an https URL or a base64 image data URI。
URL 是 WideRouter 在服务端取的,所以必须能从公网访问到。域名解析不了、
或者返回的不是图片,任务会在入队之后失败,而不是在提交时被拒。
计价
这几个模型走Grok-Official 分组。WideRouter 的标价与 xAI 官方价完全一致——
折扣体现在分组倍率上,Grok-Official 的倍率是 0.8。所以实际扣费是:
两条容易漏掉的规则:
- 参考图另外收费,每张约 $0.01,加在出图价之上。三图合成按「一张输出 + 三张输入」计。
n是乘的。2k/medium出四张就是单张价的四倍,没有批量折扣。
完成的任务里带一个
usage.cost_in_usd_ticks 字段,10000000000 ticks 等于 $1。
这个数字是原价,还没乘分组倍率。乘上你所在分组的倍率,才是实际从余额里扣掉的数。时延
异步接口上从提交到completed 的端到端实测,默认参数各一个样本:
快到这个程度,异步那一圈往返——提交,然后每两三秒轮询一次——花掉的墙钟时间
往往比生成本身还多。典型结果是轮询两次就拿到了。
同步接口形态
三个模型同样在POST /v1/images/generations 上应答,挂住连接直接把图给你。
data 加 usage。data[0] 里装什么取决于 response_format:
b64_json 直接给字节,url 给一个链接。
同步链路对「只想立刻拿到字节」的脚本更简单,代价是整个生成期间都要挂住连接——
2k 实测 19.4 秒。跑在 Serverless 函数、反向代理或移动端后面的场景应当走异步。
下一步
Playground
在浏览器里真实发一次请求,看着任务跑完。
Grok Imagine 视频
这个系列的视频那一半——生成、编辑与延长片段。