grok-imagine-video-1.5 解析度更高、能用預設音色;
而 grok-imagine-video 是唯一接受影片作為輸入的,編輯和延長都要靠它。
用哪個取決於你是要造一段片子,還是要改一段現成的。
系列總覽
向一個模型要它做不到的事,會在提交時就被拒、不會入隊,而且訊息會告訴你該換哪個:
三種模式
input.mode 決定模型做什麼,取 generate、edit 或 extend,預設 generate。
edit 按提示詞改寫一段現成的片子並保持長度,所以它不接受 resolution——
輸出跟隨源片。extend 是在末尾接一段新畫面。
duration: 3,產出 6.04 秒——原片加三秒延長段,
不是重新渲染。
參數
下面這些都放在input 裡。信封見非同步任務 API。
沒有
n——影片模型每個任務只產一段。
和影像模型不同,影片沒有
auto 畫幅,也沒有超寬比例。上面七個就是全部。解析度與時長
實測輸出畫素,每檔一個樣本:1080p 在 grok-imagine-video 上會被拒:
1080p is only available on grok-imagine-video-1.5。
產物比請求的時長多約 0.04 秒——要 3 秒,檔案是 3.04 秒。
每個樣本都是這樣,且不影響計費,計費按請求的時長算。
參考圖、首幀與音色
能喂進去的有三樣東西,其中兩樣互斥:images是首幀。恰好一張,片子從這一幀往後動。reference_images是風格與主體參考,最多三張。兩個模型都接受, 而且一旦用了,輸出封頂720p——reference_images配1080p會被拒:reference images are capped at 720p。- 兩個同時給會被拒:
cannot be combined with images; a first frame and reference images are different modes。
voice_ids 在 grok-imagine-video-1.5 上選預設音色,每段最多三個。合法取值:
WideRouter 上沒有自定義音色。注意音色 ID 本身不在提交時校驗——寫錯的名字會被
接受,然後任務失敗。音色和
generate_audio: false 都不改變價格。
計價
這幾個模型走Grok-Official 分組。WideRouter 的標價與 xAI 官方價完全一致——
折扣體現在分組倍率上,Grok-Official 的倍率是 0.8。所以實際扣費是:
有三條規則是光看每秒單價看不出來的:
- 你送進去的媒體也要收費。 一張參考圖約 $0.01;
edit與extend的源片 按它自己的長度算,每秒約 $0.01。 extend不對原片重複收費。 只有新增的那一段按每秒單價計,再加源片作為輸入。 實測:把一段 3.04 秒的片子延長 3 秒花了 $0.18——三秒輸出按 $0.05 加上 3.04 秒輸入按 $0.01——而結果是 6.04 秒。從頭生成六秒要 $0.30。edit大約按源片長度收兩遍,一遍算輸出一遍算輸入。 實測:編輯一段 1.04 秒的片子花了 $0.06。
grok-imagine-video 出三秒 480p:
完成的任務裡帶一個
usage.cost_in_usd_ticks 欄位,10000000000 ticks 等於 $1。
這個數字是原價,還沒乘分組倍率。乘上你所在分組的倍率,才是實際從餘額里扣掉的數。時延
非同步介面上從提交到completed 的端到端實測:
比人們常說的「影片模型通常要幾分鐘」快得多,但仍然慢到不能掛連線等——
這正是它沒有同步端點的原因。每兩三秒輪詢一次,客戶端超時按這張表最慢的那一行設,
不要按最快的設。
任務失敗時
影片的失敗是一個failed 狀態的任務加一個 error 物件,不是 HTTP 錯誤——
查詢端點仍然返回 200。常見的 code 是 upstream_error,訊息由 xAI 原樣透傳:
下一步
Playground
在瀏覽器裡真實提交一個影片任務並輪詢到完成。
Grok Imagine 圖片
這個系列的影像那一半——三個變體與品質檔位。