curl.
Variantes
Todas as variantes são assíncronas. Envie via
POST /api/v1/video/queue, e depois faça polling em POST /api/v1/video/retrieve até o corpo da resposta ser video/mp4. Veja Geração de vídeo para o fluxo geral de fila.
O modelo “um modelo, quatro workflows”
A variante reference-to-video (seedance-2-0-reference-to-video e sua versão Fast) é o mesmo modelo subjacente servindo quatro tarefas diferentes. O modelo infere a tarefa a partir do prefixo do prompt e do formato das suas entradas. Não há campo task ou workflow — a sintaxe do prompt é o roteamento.
A sintaxe do prompt é canônica e sensível a maiúsculas: colchetes angulares, primeira letra maiúscula, um único espaço antes do número —
<Video 1>, <Image 1>, <Audio 1>.
Padrões de workflow
Workflow Reference
Use os arquivos de referência enviados como doadores — sujeito, cena, movimento, estilo, timbre vocal — para gerar um vídeo totalmente novo. Padrões de prompt canônicos:Refer to <Subject 1> in <Image 1> to generate a 5-second clip of the same character riding a horse through snow.Refer to the camera scene in <Video 1> to generate a similar establishing shot of a futuristic city at dawn.Refer to <Subject 1> in <Image 1> and use the timbre in <Audio 1> for the narrator describing the scene.(doadores de áudio devem ser pareados com pelo menos uma referência de imagem ou vídeo — apenas áudio é rejeitado)
Workflow Edit
Modifique um único vídeo de entrada. Qualquer coisa que não seja explicitamente nomeada no prompt é preservada. Use isso quando você quer uma mudança localizada (troca de sujeito, mudança de clima/cor, adição/remoção de elemento) em vez de um vídeo totalmente novo. Padrão de prompt canônico:Strictly edit <Video 1>, changing its weather from sunny to a heavy rainstorm.Add snacks such as fried chicken and pizza to the countertop in <Video 1>.Remove the red car from <Video 1>, keeping the rest of the video content unchanged.Replace the perfume featured in <Video 1> with the face cream from <Image 1>, with all original motions and camera work preserved.
<Image 1> como doador visual para a substituição.
Workflow Extend
Continue um único clipe para frente ou para trás no tempo. Por padrão, o Seedance retorna apenas o novo conteúdo — não o input original concatenado com a extensão. Isso é por design, para continuidade da transição; se você quiser que o clipe de input seja preservado junto com a extensão, diga isso explicitamente:Extend <Video 1>, generate a dramatic chase scene through narrow alleys at dusk.Extend <Video 1> backward, the same character walking toward the camera before the original shot begins.Extend <Video 1>, start with <Video 1>, then the camera pulls back to reveal a vast landscape.
Workflow Stitch (Track Completion)
Conecte 2-3 clipes de input com transições geradas por IA. A duração total combinada de input deve ser ≤ 15 s. Padrão de prompt canônico:<Video 1> + a smooth seamless cut + followed by <Video 2><Video 1>. The moment a leaf falls to the ground, it sets off a special effect of golden particles. A gust of wind blows by, leading into <Video 2>.<Video 1> + a wisp of smoke transforms into a flock of birds + followed by <Video 2> + a slow dolly-in + followed by <Video 3>
Fórmula de prompt universal
Em todos os quatro workflows, a fórmula de autoria recomendada é:- Subject + Motion: a base lógica — define “Quem” está realizando “Qual ação”
- Environment + Aesthetics: plano de fundo espacial, iluminação, estilo visual
- Camera: tipo de plano ou movimento explícito
- Audio: efeitos sonoros ambientes ou direção vocal para saída imersiva
Strictly edit <Video 1>, changing its <subject + motion + environment + ...>) produz as saídas de mais alta qualidade.
Limites de entrada multimodal
Os valores abaixo são o que a API Venice aceita. Requisições fora dessas faixas são rejeitadas na camada de schema com um 400 antes de chegar à inferência.Imagens
Vídeos
Áudio
Áudio de referência é suportado apenas nas variantes R2V. Cada entrada é encaminhada ao modelo como um item de conteúdo
role: "reference_audio" que o prompt endereça como <Audio 1>, <Audio 2>, <Audio 3> — o modelo usa cada clipe para timbre vocal, efeitos sonoros ou música de fundo dependendo de como o prompt o enquadra. O campo legado singular audio_url mapeia para o mesmo formato de conteúdo e agora é equivalente a passar um reference_audio_urls com um único elemento.
Tamanho da requisição
O endpoint de queue aceita corpos JSON de até 35 MB. Data URLs inline para vídeos grandes podem ultrapassar isso — para Stitch multi-clipe em particular, prefira URLs em vez de base64 inline.Preços
ChamePOST /api/v1/video/quote para obter uma cotação para um determinado formato de requisição antes de enviá-la a /video/queue. O endpoint de cotação é a única fonte oficial; detalhes de preços podem mudar e não devem ser cacheados ou duplicados no cliente.
Quando vídeo(s) de referência fizerem parte da requisição, também passe reference_video_total_duration (a soma de todas as durações de clipes de referência em segundos) para que a cotação corresponda ao que /video/queue vai cobrar:
Exemplos completos
Todos os exemplos assumem queVENICE_API_KEY está definido no ambiente.
Text-to-video
Image-to-video (primeiro frame)
seedance-2-0-image-to-video (e sua variante Fast) não aceitam aspect_ratio — o aspect ratio de saída é auto-derivado das dimensões da imagem de input. Passar o campo retorna um 400 com “This model does not support aspect_ratio”. Use as variantes T2V ou R2V se precisar de controle explícito de aspect ratio.Workflow Reference — doador de sujeito
Workflow Reference — doador de sujeito + áudio
Workflow Edit
Workflow Edit com grounding de imagem
Extend para frente
Stitch (3 clipes)
Polling para conclusão
Após cada envio à fila, salve oqueue_id retornado e faça polling em /video/retrieve até o corpo da resposta ser video/mp4:
{ "status": "queued" | "running" | "failed", ... }) até o job ser concluído, momento em que o corpo da resposta passa para bytes video/mp4. Veja Geração de vídeo para o padrão completo de polling.
Solução de problemas
At least one reference is required for this model
Envios de reference-to-video devem incluir pelo menos um de reference_image_urls, reference_video_urls, image_references ou video_references. Geração apenas com texto não é um workflow R2V válido — use seedance-2-0-text-to-video em vez disso. reference_audio_urls sozinho não é suficiente (veja a seção Áudio acima).
reference_video_urls must have at most 3 videos
O modelo limita os vídeos de referência a 3. Se precisar de mais clipes, execute um Stitch primeiro (3 → 1) e depois use a saída como referência para uma sequência.
Per clip must be 2–15s / agregado > 15s
Duração por clipe é [2, 15] segundos inclusivo; a soma em todos os vídeos de referência também é limitada a 15 segundos. Apare os clipes no cliente antes do envio.
O prompt vai para o workflow errado
O workflow é inferido pela sintaxe do prompt. Erros comuns de roteamento:- Querer Extend mas escrever
Refer to ...→ o modelo trata seu vídeo como um doador, não como um canvas a continuar - Querer Stitch mas escrever
Refer to ...→ o modelo escolhe um como doador, ignora os outros - Querer Edit mas escrever
Generate a video based on <Video 1>→ ambíguo; o modelo pode optar por Reference
Strictly edit <Video 1>, ..., Extend <Video 1>, ..., <Video 1> + ... + followed by <Video 2>.
A cotação não corresponde ao valor enfileirado
Se você incluiu um vídeo de referência mas não passoureference_video_total_duration para /video/quote, a cotação e o valor enfileirado podem diferir. Sempre passe reference_video_total_duration (soma de todas as durações dos clipes de referência, em segundos) quando vídeos de referência estiverem presentes.
Referências
- Endpoint de fila de vídeo da Venice:
POST /api/v1/video/queue - Endpoint de cotação da Venice:
POST /api/v1/video/quote - Guia companheiro: Reference to Video (cobre Kling O3 + Grok Imagine R2V)
- Guia companheiro: Geração de vídeo (visão geral de fila / polling)