All models

whisper-1

OpenAIAudio
0.0014 Credits
Get your API key
whisper-1

把录音转成原语言文字与可用字幕

whisper-1 是 OpenAI 的语音转文字模型,官方 API 发布时对应 Whisper large-v2。它适合将访谈、课程、语音留言和影音素材中的语音整理成原语言文字,并按工作流选择文本、JSON 或字幕格式。在本平台中,可通过音频转写入口提交文件,把录音处理接入内容制作与资料整理流程。

OpenAI模型品牌
音频模型类型
音频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

原生模型关系
Whisper large-v2;API 调用 ID 为 whisper-1
输入与输出
音频文件输入,原语言文字转写输出
原生文件格式
m4a、mp3、mp4、mpeg、mpga、wav、webm
调用入口
POST /v1/audio/transcriptions;提交二进制 file
输出格式选项
json、text、srt、verbose_json、vtt;默认 json
转写控制
可传 language、prompt;temperature 默认 0

原生格式说明与调用参数分别列示;本入口以文件转写为核心,不等同于实时语音对话。

核心能力

了解 whisper-1 能为你的工作带来什么。

保留原语言的转写路径

whisper-1 的转写任务是把音频中说出的内容转为原语言文字,而不是默认译成英语。这适合需要保留原始表述的采访、课程和口述材料。生成的文字可作为后续检索、摘录与编辑的基础,摘要和改写则应作为独立处理步骤。

文字与字幕分别交付

同一转写工作流可以按用途选择输出格式:text 适合直接进入编辑器,JSON 便于程序读取文字,SRT 与 VTT 适合字幕制作。选格式时应围绕最终交付物设计,避免先保存纯文本,再额外重建字幕结构与处理流程。

围绕文件组织调用

调用以音频文件为中心,不需要把录音转换成聊天消息。请求可携带语言与提示文本,方便应用组织转写上下文;提示应围绕录音内容准备,而不是当作自由创作指令。这样更容易将上传、转写、保存和人工校对串成稳定流程。

适用场景

从具体任务出发,找到模型发挥作用的位置。

采访与口述资料整理

将采访录音或口述材料作为文件提交,选择文本或 JSON 输出,得到便于检索与编辑的转写稿。编辑人员可据此定位主题、整理引用,并对人名、机构名和关键原话回听核实;文章结构与观点提炼可在转写完成后另行处理。

课程与影音字幕制作

为课程录音或影音素材选择 SRT、VTT 输出,将结果送入字幕编辑或播放工作流。交付前结合原素材检查断句、文字与时间对应关系;模型承担语音转写环节,字幕排版、视觉样式和成片导出仍由制作工具完成。

语音留言归档

把用户语音留言转成文字,供工单系统或资料库保存。应用可读取 JSON 中的 text,将转写内容关联到原音频,便于工作人员查阅和回听。分类、优先级判断与回复生成应另设处理步骤,不把转写结果直接当成业务决策。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

需要文字底稿时选择它

如果核心需求是处理已有录音,并交付原语言文字或字幕,whisper-1 的任务边界清晰。它不是普通问答模型,也不是语音合成模型:不会把文字念成音频,更不应承担自动写纪要的全部工作。先完成转写,再接摘要或编辑流程,更便于核对原话。

按版本与任务区分选择

whisper-1 是 API 调用名称,large-v2 是官方发布时对应的原生版本,不能理解为所有 Whisper 新版本的统称。比较其他转写型号时,建议用相同录音检查专有名词、断句和所需输出格式;若目标是英语翻译,也要区分原语言转写与独立翻译任务。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 转写文字不是自动生成的摘要、会议结论或说话人身份记录。多人录音需要区分发言者时,应单独安排说话人标注环节;不要仅凭转写文本推定每句话的归属,重要引用应保留与原音频的对应关系。
  • 输入应使用音频文件,不要把 PDF、聊天文本或网页链接直接当成二进制 file 提交。通过 MCP 的音频 URL 工具调用时,也应与 HTTP 文件上传流程区分;文件准备和读取方式取决于采用的客户端。
  • 文件转写不等于边录边识别的实时语音服务,字幕输出也不等于完成全部剪辑工作。需要实时交互、精细时间对齐或正式字幕交付时,应围绕实际音频测试流程,并安排回听与字幕编辑。

常见问题

解答使用 whisper-1 时的常见疑问。

whisper-1 与 Whisper large-v2 是什么关系?

whisper-1 是调用 API 时使用的模型名称,OpenAI 的 Whisper API 发布说明将其对应到 large-v2。两者分别描述调用名称与原生版本,不应把 whisper-1 当成所有 Whisper 版本的通用别名,也不能据此认定它就是最新版本。

中文录音会自动变成英文吗?

音频转写入口的任务是按原语言输出文字,不是默认翻译成英语。官方将原语言转写与英语翻译区分为不同任务。因此,处理中文录音时应按中文转写流程使用;如果需要英文稿,应另外安排翻译步骤。

能直接生成 SRT 或 VTT 字幕吗?

调用参数提供 srt 与 vtt 输出选项,可用于字幕工作流;纯文字任务则可选择 text 或 json。字幕生成后仍需结合音频检查内容、断句与时间对应,再交给字幕编辑或播放工具,不应直接视为已经完成的成片。

prompt 能让它把录音改写成文章吗?

prompt 是转写请求中的提示文本,不应把它当成通用写作指令。whisper-1 的核心交付物仍是音频文字稿。需要文章、摘要或行动项时,建议保留原始转写结果,再交给独立的文本处理步骤,避免混淆原话与加工内容。

应该上传文件,还是提交音频 URL?

直接调用 /v1/audio/transcriptions 时,需要提交二进制 file,并使用 whisper-1。若使用 MCP 客户端,可选择其从 URL 转写音频的工具。两种方式的输入组织不同,不要将 URL 字符串直接作为 HTTP 的二进制文件字段。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 whisper-1 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。