grok-imagine-video-1.5은 더 높은
해상도로 생성하며 사전 설정 음성을 사용할 수 있습니다. grok-imagine-video은
동영상을 입력으로 받는 유일한 모델이며, 이는 편집과 확장에 필요합니다.
클립을 새로 만들지, 기존 클립을 변경할지에 따라 사용할 모델이 달라집니다.
시리즈 한눈에 보기
모델에서 지원하지 않는 작업을 요청하면 대기열에 추가되기 전에 제출 시점에
실패하며, 대신 사용할 모델을 안내하는 메시지가 표시됩니다.
모드
input.mode은 모델이 수행할 작업을 선택합니다. generate, edit 또는
extend을 사용하며, 기본값은 generate입니다.
edit은 프롬프트를 사용해 기존 클립을 다시 작성하고 길이를 유지하므로
resolution을 허용하지 않습니다. 출력은 원본을 따릅니다. extend은 새로운
영상을 끝에 추가합니다.
duration: 3을 사용한 3.04초 원본에서 6.04초
클립이 생성되었습니다. 이는 다시 렌더링한 것이 아니라 원본에 3초를 확장한 결과입니다.
매개변수
아래의 모든 항목은input 안에 들어갑니다. 엔벌로프는
비동기 작업 API에 설명되어 있습니다.
n은 없습니다. 동영상 모델은 작업당 하나의 클립을 생성합니다.
이미지 모델과 달리 동영상에는
auto 가로세로 비율이 없으며 초광각
비율도 없습니다. 위의 7가지 값이 전체 목록입니다.해상도 및 길이
측정된 출력 픽셀, 티어당 샘플 하나:1080p은 grok-imagine-video에서
1080p is only available on grok-imagine-video-1.5와 함께 거부됩니다.
클립은 요청한 길이보다 약 0.04초 더 길게 반환됩니다 — 3초를 요청하면
파일 길이는 3.04초입니다. 이는 모든 샘플에서 일관되며, 요청한 길이를 기준으로
과금되므로 청구 금액에는 영향을 주지 않습니다.
참조 이미지, 첫 프레임 및 음성
세 가지 항목을 입력할 수 있으며, 그중 두 가지는 상호 배타적입니다.- **
images**은 첫 프레임입니다. 이미지는 정확히 하나만 사용할 수 있으며, 클립은 해당 프레임에서 바깥쪽으로 애니메이션됩니다. - **
reference_images**은 스타일 및 주제 가이드이며, 이미지는 최대 세 개까지 사용할 수 있습니다. 두 모델 모두 이를 지원하지만, 사용하면 출력이 **720p**로 제한됩니다. 따라서reference_images과1080p를 함께 사용하면reference images are capped at 720p와 함께 요청이 거부됩니다. - 두 항목을 모두 전달하면 요청이 거부됩니다.
cannot be combined with images; a first frame and reference images are different modes.
voice_ids은 grok-imagine-video-1.5에서 사전 설정된 음성을 선택하며, 클립당 최대 세 개까지 선택할 수 있습니다. 허용되는 값은 다음과 같습니다.
WideRouter에서는 사용자 지정 음성을 사용할 수 없습니다. 음성 ID 자체는 제출 시점에 검증되지 않는다는 점에 유의하십시오. 인식할 수 없는 이름도 허용되지만, 이후 작업이 실패합니다. 음성과
generate_audio: false는 모두 가격을 변경하지 않습니다.
요금
이 모델들은Grok-Official 그룹을 통해 제공됩니다. WideRouter의 정가 목록은 xAI의 공식 가격과 정확히 일치하며, 할인은 그룹 요율 배수에 적용됩니다. Grok-Official의 경우 0.8입니다. 따라서 실제 지불 금액은 다음과 같습니다.
초당 요금만으로는 알 수 없는 세 가지 규칙은 다음과 같습니다.
- 전송하는 미디어에도 요금이 부과됩니다. 참조 이미지를 추가하면 약 $0.01이
부과됩니다.
edit또는extend의 소스 클립에는 해당 클립 자체의 길이에 따라 초당 약 $0.01의 요금이 부과됩니다. extend는 원본에 다시 요금을 부과하지 않습니다. 새 세그먼트에만 초당 요금이 부과되며, 소스 클립은 입력으로 별도 요금이 부과됩니다. 측정 결과, 3.04초 클립을 3초 연장하는 데 $0.18이 들었습니다. 이는 $0.05의 출력 3초분과 $0.01의 입력 3.04초분을 합한 금액이며, 결과물의 길이는 6.04초입니다. 6초를 처음부터 다시 생성했다면 $0.30이 들었을 것입니다.edit에는 소스 길이의 약 두 배에 해당하는 요금이 부과됩니다. 출력과 입력에 각각 한 번씩 요금이 부과됩니다. 측정 결과, 1.04초 클립을 편집하는 데 $0.06이 들었습니다.
grok-imagine-video에서 480p를 3초 생성하는 경우입니다.
완료된 작업에는
usage.cost_in_usd_ticks이 적용되며, 여기서 10000000000 틱은
$1입니다. 이 금액은 정가이며 그룹 요율 배수를 적용하기 전의 값입니다.
실제로 잔액에서 차감되는 금액을 확인하려면 여기에 그룹의 요율을 곱합니다.지연 시간
비동기 API에서 엔드투엔드로 측정했으며,completed에 제출합니다:
생성은 동영상 모델에 흔히 언급되는 “보통 몇 분”보다 훨씬 빠르지만,
연결을 계속 열어 둘 수 없을 만큼은 여전히 느립니다. 따라서 동기식 엔드포인트는 없습니다. 2~3초마다 폴링하고, 클라이언트 타임아웃은 가장 빠른 행이 아니라
여기서 가장 느린 행을 기준으로 설정하십시오.
작업이 실패하는 경우
동영상 실패는 HTTP 오류가 아니라error 객체가 포함된 failed 작업으로 반환됩니다. 읽기 엔드포인트는 여전히 200를 반환합니다. 일반적인 코드는
upstream_error이며, 메시지는 xAI에서 그대로 전달됩니다.
다음 단계
Playground
브라우저에서 실제 동영상 작업을 제출하고 완료될 때까지 폴링합니다.
Grok Imagine 이미지
제품군의 이미지 부분 — 세 가지 변형과 품질 그리드입니다.