All models

veo3 ★

GoogleVideo
5–7.64 Credits
Get your API key
veo3

让画面对白与场景声音一起生成的视频模型

Veo 3 是 Google 的视频生成模型,重点是把动态画面、人物对白和场景声音放在同一次创作中完成。它适合有明确镜头设计的广告片段、产品演示与叙事短场景。在本平台中,veo3 支持文字创作和图片驱动创作,可用首帧或首尾帧组织画面,并通过异步任务获取视频结果。

Google模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

原生音画能力
视频与音频联合生成,支持对白、口型同步及场景音效
原生公开清晰度
1080p 高清视频
创作方式
文生视频、图生视频;veo3 为 Quality 模式
图片控制
1 张首帧参考;2 张首尾帧参考
视频画幅
16:9 横屏、9:16 竖屏
输出选项
默认 720p,可选 1080p、gif;支持 get1080p
调用与交付
POST /veo/videos,model=veo3;支持异步任务、回调和视频链接交付

原生规格描述 Veo 3 的音画生成能力,画幅、图片控制和结果获取方式对应本平台的调用入口。

核心能力

了解 veo3 能为你的工作带来什么。

声音参与场景创作

Veo 3 不只生成无声画面,还能把人物说话、口型和环境音效一起纳入场景。创作咖啡店对话或产品讲解时,可在提示词中分别写清谁说话、说什么,以及背景声音,让声音成为镜头叙事的一部分,而不是只留给后期补充。

从静态图片设计运动

有现成视觉素材时,可用图片确定画面起点,再用文字描述人物动作、物体运动和镜头变化。一张图片适合让产品照或插画动起来;两张图片用于首尾帧创作,适合先确定开场与收束构图,再设计中间的动态过程。

镜头结果接入应用

文字创作适合从场景描述起步,图像创作适合已有构图的任务。完成后可获取视频链接及视频 ID,并继续获取 1080p 版本。异步任务与回调便于把生成流程接入内容工作台,不必让用户一直等待同一个请求完成。

适用场景

从具体任务出发,找到模型发挥作用的位置。

带对白的广告片段

输入产品卖点、人物动作、简短台词和场景氛围,制作有人物讲述的广告镜头。例如让店员介绍新品,并写明顾客回应和店内环境声。交付物是可供挑选、剪辑的音画片段,适合先验证广告表达,再补充品牌字幕与包装。

产品图片动态展示

输入产品图片和运动要求,制作镜头缓慢推进、主体转动或背景产生变化的展示片段。若已有开场和结尾设计,可提交首尾帧图片,引导画面从展示状态过渡到收束状态,生成素材再用于商品介绍或社交媒体视频。

故事镜头与培训情境

把脚本拆成明确的短场景,逐段描述角色、空间、动作与对白,生成故事分镜或服务培训情境。例如制作柜台点单、接待问询等交流镜头。交付后按脚本顺序剪辑,并检查对白和动作是否符合教学目标,而非直接当作完整课程。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

重视镜头质量,选择标准版

veo3 属于 Quality 模式,适合把重点放在正式素材的镜头表现与音画表达上。veo3-fast 的定位更偏向速度和快速迭代;需要探索多种广告创意或反复调整提示词时,可先考虑 Fast。两者是不同版本,不应把速度定位理解为固定完成时间。

按参考方式选择相关版本

只有文字、单张起始图片或一组首尾帧时,veo3 的创作方式已经覆盖这些需求。如果任务需要把多张图片中的人物、服饰和产品元素组合进同一场景,应考虑 veo31-fast-ingredients;若明确需要 4K 输出,则考虑支持该选项的 veo31。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • veo3 不支持 4K 输出,也不能把首尾帧创作当作多图素材融合。两张图片分别用于控制开始和结束画面;需要组合多个独立参考元素时,应选择相应的多图创作型号,而不是继续增加图片数量。
  • 原生对白与口型同步能力不等于逐字、逐帧准确保证。正式发布前,应检查台词内容、发音、嘴部动作和环境声;品牌名称或关键说明建议保留字幕校对与后期修订环节。
  • 首尾帧可以帮助确定镜头边界,但不代表中间动作会严格按分镜执行。复杂转场建议先简化为明确的主体和运动关系;需要完整长片时,应拆分镜头生成,再剪辑组织成连续叙事。

常见问题

解答使用 veo3 时的常见疑问。

veo3 和 veo3-fast 怎么选?

veo3 是 Quality 模式,适合重视镜头表现的素材制作;veo3-fast 更偏向快速迭代,适合探索创意和测试提示词。选择时先看任务阶段:概念试验优先考虑 Fast,正式镜头可考虑标准版,不必假定每次都存在相同的耗时差。

一张图片和两张图片有什么区别?

将 action 设为 image2video,通过 image_urls 提交图片链接。一张图片用于首帧创作,两张图片用于首尾帧创作。提示词应描述从起点到终点的动作与镜头变化,而不是把两张图片当成可自由融合的素材集合。

能生成对白和环境声音吗?

Veo 3 具备原生音画联合生成能力,可以创作人物对白、口型同步和场景音效。建议在提示词里明确说话角色、台词与背景声,并在结果中试听检查。提示词自动翻译是文字处理功能,不等同于视频对白配音或语言转换。

怎样获取 1080p 视频?支持 4K 吗?

可以选择 resolution=1080p,也可对已生成的视频使用 action=get1080p。后一种方式需要提交结果中的视频 ID 作为 video_id,不是 task_id。veo3 不支持 4K;对输出清晰度有更高要求时,可考虑 veo31。

如何在应用里等待 veo3 生成完成?

设置 async=true 可先取得 task_id,随后查询任务结果;也可设置 callback_url 接收完成通知。成功结果包含视频链接、视频 ID 和状态。应用应以完成状态为准展示视频,并区分任务 ID 与视频 ID,分别用于跟踪任务和获取高清版本。

把 veo3 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。