Skip to main content
POST

认证

string
必填
所有接口均需要使用 Bearer Token 进行认证。获取 API Key:访问 API Key 管理页面 获取您的 API Key。使用时在请求头中添加:

请求参数

string
必填
视频生成模型名称,固定为 gemini-omni-1.1-flash
string
文本指令。文生视频时用于描述场景;图生视频、视频编辑或续写时用于描述动作、风格和编辑要求。
prompt 与素材(image_urls、首尾帧图片或 video_urls)至少提供一项。
string
默认值:"720p"
输出视频分辨率,不区分大小写。可选值:
  • 360p
  • 720p(默认)
  • 1080p
  • 4k
2160p 会按 4k 处理。分辨率决定任务的预扣押金档位和主要视频输出成本。
传入不支持的分辨率会返回 invalid_resolution 错误。
string
默认值:"16:9"
视频宽高比,用于控制横屏或竖屏。支持:
  • 16:9 - 横屏(默认)
  • 9:16 - 竖屏
其它值按 16:9 处理。
传入 video_urls 后,输出画面比例通常跟随输入视频,aspect_ratio 可能不生效。
array<string>
参考图片数组。仅支持公网可访问的 HTTP/HTTPS URL。
  • 传入 1 张图片:默认作为视频的起始画面
  • 传入多张图片:作为多主体或风格参考图,请在 prompt 中说明各图片的用途和互动关系
image_urls 与首尾帧图片合计最多 10 张。
string
首帧图片。仅支持公网可访问的 HTTP/HTTPS URL。
  • 单独传入:以该图片作为视频的起始画面
  • last_frame_image 同时传入:生成从首帧平滑过渡到尾帧的视频
string
尾帧图片。仅支持公网可访问的 HTTP/HTTPS URL,且必须与 first_frame_image 同时传入。
只传 last_frame_image 会返回 invalid_frame_images 错误。首尾帧图片建议使用相同比例,并与 aspect_ratio 保持一致。
在首帧或首尾帧场景中,以下两种传参方式效果相同,二选一即可,请勿同时传入
  • 使用 first_frame_image / last_frame_image
  • 使用 image_with_roles,并将 role 设置为 first_frame / last_frame
array<object>
带角色的图片数组,可作为 first_frame_image / last_frame_image 的等价写法,也可以用于声明参考图。示例:
若同时传入 image_urls,参考图以 image_urls 为准,不与 image_with_roles 中的参考图叠加。所有实际使用的图片与首尾帧合计最多 10 张。
array<string>
待编辑或续写的视频数组,当前最多传入 1 段,且视频时长不得超过 10 秒。仅支持公网可访问的 HTTP/HTTPS 视频直链,不支持 YouTube 链接。
video_urlsextend_from_task_id 互斥,二者只能提供一项。
object
附加参数对象,用于显式指定生成意图。
使用首尾帧插值时,任务类型由模型自动推断,平台不会下发 metadata.task
string
上一次生成任务的本地 task_id,用于对话式编辑或继续延长视频,无需重新上传上一轮视频。被引用的任务必须属于当前用户、状态为成功,并且是 Gemini Omni 模型任务。
extend_from_task_idvideo_urls 互斥,二者只能提供一项。
该模型没有 duration 参数。单次输出时长由模型根据内容自动决定,通常为 3–10 秒。如需控制节奏,请在 prompt 中使用自然语言或时间段描述。

响应

integer
响应状态码,成功时为 200
array
返回任务数组。

查询任务结果

视频生成为异步任务。提交后会返回 task_id,使用 获取任务状态 接口查询生成进度和结果。
cURL
建议每 5–10 秒轮询一次,并在状态变为 completedfailed 后停止。客户端整体超时建议设置为 10 分钟。

成功结果示例

使用场景

场景 1:文生视频(4K)

场景 2:首尾帧插值

场景 3:多主体参考

场景 4:使用图片角色声明首尾帧

场景 5:视频编辑

视频编辑建议使用简短、明确的提示词。若只希望修改某一部分,可在提示词中加入 Keep everything else the same 以增强其余画面的一致性。

场景 6:对话式续写