何时使用 Reference to Video
在以下情况下使用 Reference to Video:- 角色一致性 — 跨多个镜头的同一个人物或角色
- 产品准确性 — 必须与原物外观完全相同的真实产品
- 场景连续性 — 跨生成的特定环境或背景
- 多角色场景 — 多个不同角色互动而不混合
可用模型
Kling O3 使用结构化方法,包括 Elements(带正面 + 参考图像的角色身份锚点)和场景图像。Grok Imagine R2V 采用更简单的方法——您直接上传参考图像并在 prompt 中用
@Image1、@Image2 等引用它们。
Kling O3 Reference to Video
核心概念
Kling O3 Reference to Video 使用三种类型的视觉输入协同工作:
*至少需要以下之一:起始帧、elements 或场景参考图像。
Elements
Element 是您希望在整个视频中保持视觉稳定的角色或对象。每个 element 包含:- 正面图像(每个 element 必需) — 主体的清晰正面照片。这是主要的身份锚点。可以将其视为您角色或产品的”护照照片”。
- 参考图像(1–3 张,可选) — 同一主体的其他角度(侧视图、45 度角、背面)。这些有助于模型在 3D 空间中理解主体。如果未提供,正面图像将自动用作参考。
@Element1、@Element2 等引用它们。
场景参考图像
场景参考定义动作发生的”舞台”。它们影响:- 光照和调色板
- 建筑和环境细节
- 整体视觉风格和氛围
@Image1、@Image2 等方式引用它们。
限制
所有输入类型的图像总数受到限制:
示例场景:
- 7 个 elements + 0 张场景图像 = 7 ✓(无帧)
- 5 个 elements + 2 张场景图像 = 7 ✓(无帧)
- 第一帧 (1) + 3 个 elements + 3 张场景图像 = 7 ✓
- 第一帧 (1) + 最后一帧 (1) + 3 个 elements + 2 张场景图像 = 7 ✓
- 第一帧 (1) + 4 个 elements = ✗(带帧时最多 3 个 elements)
- 第一帧 (1) + 最后一帧 (1) + 4 个 elements = ✗(带帧时最多 3 个 elements)
每个 element 都需要正面图像。如果您不为 element 提供参考图像,正面图像将自动用作参考。
多镜头模式
多镜头让您将单次生成拆分为多个场景,每个场景都有自己的 prompt 和时长。Elements 和场景参考跨所有镜头保留,保持一致性。所有镜头的总时长不能超过 15 秒。分步指南(Video Studio)
1. 打开 Video Studio 并选择模型
前往 venice.ai/video。在左侧的 Model Browser 中,选择 Kling O3 Reference to Video 模型之一:- Kling O3 Pro R2V — 更高质量,生成时间更长(~6 分钟)
- Kling O3 Standard R2V — 更快,更经济,适合迭代
2. 添加视觉输入(至少需要一个)
您必须提供至少一个视觉输入才能生成视频:起始帧、element 或场景参考图像。在输入面板中,您将看到 Elements 部分。点击 Add Element 为您希望保持视觉一致的角色或对象创建 element。 对于每个 element:- 点击 Frontal 图块上传您的角色或对象的清晰正面图像
- 可选地点击 Reference Images 下的 Add 上传额外角度(1–3 张)
3. 添加场景参考图像(可选)
在 Elements 部分下方,您将看到 Scene Reference Images。上传定义您想要的环境的图像——特定位置、光照设置或艺术风格。 这些自动标记为@Image1、@Image2 等。
4. 上传起始帧(可选)
如果您想精确控制视频的第一帧,切换到 Image 输入类型并上传起始帧。您还可以选择性地设置结束帧。5. 编写您的 prompt
在 prompt 字段中,描述您想要的动作,同时使用@ 标签引用您的 elements 和场景图像:
6. 配置设置
打开 Video Settings 调整:音频生成添加与视频同步的原生音效、对话和环境音频。它会使成本增加约 25%。
7. 生成
点击 Generate Video。Kling O3 通常需要 4–6 分钟,具体取决于模型层级和时长。您可以排队多个生成并在 Video Gallery 中浏览结果。多镜头故事板
对于叙事序列,使用多镜头模式在单次生成中定义独立的场景。- 在 prompt 区域,点击 Add Shot 创建额外的镜头
- 为每个镜头编写单独的 prompt
- 为每个镜头设置时长(每个 3–15s,总计 ≤ 15s)
Prompt 技巧
构建您的 prompt
按照此模式获得可靠结果:保持 prompt 在 50–150 字之间
较短的 prompt 缺少细节。较长的 prompt 会引入矛盾。瞄准甜蜜点。使用简单的摄影机语言
模型对简单的摄影机指令响应最好:使用一致的词汇
如果您在一个 prompt 中描述角色穿着”a red jacket”,请勿在下一个 prompt 中切换为”crimson coat”。模型将不同的词视为不同的意图。将摄影机指令放在前面
将摄影机指令放在 prompt 开头附近以获得更可靠的结果:Kling O3 定价
Kling O3 Reference to Video 模型使用基于时长的定价:
示例: 一段 10 秒带音频的视频 = 10 × 1.40**
生成前使用 Video Quote API 获取精确定价。
Kling O3 API 用法
Kling O3 Reference to Video 也通过 Venice API 可用。完整详情请参阅 Video Queue API。Python
Node.js
cURL
Element 模式
elements 数组中的每个 element 接受:
API 还支持基于视频的 element 的
video_url,但目前在 Video Studio UI 中不可用。Kling O3 故障排查
Grok Imagine Reference to Video
Grok Imagine R2V 采用比 Kling O3 更简单的方法。它不是带有正面/参考图像分离的结构化 Elements,而是上传扁平参考图像并使用@Image1、@Image2 等在 prompt 中直接引用它们。模型将这些主体整合到生成的视频中。
工作原理
- 上传 1–7 张参考图像 — 您希望在视频中出现的角色、对象或场景的照片
- 编写描述视频的 prompt,使用
@Image1、@Image2等引用特定图像 - 模型生成融入这些参考的视频
@Image 标签,所有上传的图像都会自动被引用。
设置
Grok Imagine R2V 不支持音频生成、多镜头模式或 Elements。要使用这些功能,请使用 Kling O3 R2V。
分步指南(Video Studio)
1. 选择模型
前往 venice.ai/video。在 Model Browser 中,选择 Grok Imagine R2V。2. 上传参考图像
点击输入工具栏中的 References(或使用 + 菜单)打开参考图像面板。上传 1–7 张您希望在视频中出现的角色、对象或场景图像。 每张图像按您上传的顺序(从左到右)自动标记为@Image1、@Image2 等。
3. 编写您的 prompt
描述您想要的视频。使用@Image 标签引用特定图像:
@ 可查看可用图像引用的自动完成菜单。
4. 配置设置并生成
打开 Video Settings 调整宽高比、分辨率和时长。点击 Generate Video。Grok Imagine R2V 定价
Grok Imagine R2V 使用基于时长和分辨率的定价:
示例: 8 秒 480p 视频 = 8 × 0.50**
Grok Imagine 对生成的视频收取内容审核费,即使视频被拒绝也是如此。这反映在生成前显示的 credit 成本中。
Grok Imagine R2V API 用法
Python
Node.js
cURL
API 参数
Grok Imagine R2V 不使用
elements、image_urls 或 imageUrl 字段。所有参考图像通过 referenceImageUrls 传递。