新闻中心back

2026年7月29日,OpenAI在API中正式推出两款新一代语音转录模型——GPT-Transcribe和GPT-Live-Transcribe。这不仅是模型能力的升级,更是一次产品战略的拆分:语音转写从此告别“一套方案打天下”,正式进入按场景精细化定价的新阶段。

图片

两条产品线,两种截然不同的定价。两款模型的定位泾渭分明:

GPT-Transcribe:面向已完成的录音文件和批量任务,通过上传音频文件进行异步转录。定价为每分钟0.0045美元,约合每小时0.27美元。相比此前GPT-4o-Transcribe每分钟0.006美元的定价,降价幅度达25%。

GPT-Live-Transcribe:面向麦克风、电话会议、直播等实时音频流,通过WebSocket或WebRTC持续接收音频并增量返回文字。定价为每分钟0.017美元,约合每小时1.02美元。两者价差约3.8倍——实时处理的成本几乎是文件转录的四倍。实时转录凭什么贵近4倍?价格差异的背后是截然不同的技术负载。

GPT-Transcribe处理的是已完成的音频文件,模型可以“从头看到尾”,以约34倍实时速度完成转录。开发者可以一次性获取完整结果,也可以让接口分段逐步返回。

而GPT-Live-Transcribe面对的是持续涌入的音频流,需要在语音尚未说完时就边听边出字。模型支持调整转录延迟——延迟越低,文字返回越早,但可能牺牲部分质量;延迟稍高,则可能提升准确率。

实时转录的溢价,买的是“即时性” 。对直播字幕、语音助手、实时会议记录等场景而言,文字能否同步出现,往往与最终准确率同等重要。

不只分两条路,还多了“三把钥匙”两款模型均支持三类上下文提示参数,这是此次更新中另一个重要变化:

· prompt:录音主题、场景和背景信息

· keywords:产品名、人名、药品名、编号等可能出现的术语

· languages:音频中预期出现的语言列表

语音识别不再只依赖音频信号,调用方可以将业务场景、术语库和语言信息直接传入模型。

效果立竿见影:在OpenAI新建立的上下文感知ASR评测中,GPT-Transcribe的语义准确率从无上下文的41.6%提升至有上下文的45.2%;GPT-Live-Transcribe则从38.5%提升至44.6%。

在Common Voice的22种语言测试中,GPT-Transcribe的错误率为19.27%,而Whisper-1高达40.37%。真实录音测试中,GPT-Transcribe错误率仅8.98%,Whisper-1为15.21%。

API商业化的“颗粒度”越来越细。从Whisper到GPT-4o-Transcribe,再到今天的GPT-Transcribe与GPT-Live-Transcribe双轨并行,OpenAI的语音API正在经历一场从“粗放统一定价”到“场景精细化定价”的演进。

这背后的逻辑很清晰:不同场景对延迟、准确率和成本的要求截然不同。把文件转录和实时转录打包成同一个产品,要么让不需要实时的用户为低延迟买单,要么让需要实时的用户忍受不够优化的体验。拆分后,每个场景都能获得更匹配的模型和更合理的价格。

OpenAI建议,大多数新项目应优先采用这两款新模型,而非沿用旧的Whisper或GPT-4o-Transcribe路径。

GPT-Transcribe和GPT-Live-Transcribe的推出,标志着OpenAI的语音API商业化进入了一个新阶段——按场景切分产品、按价值差异化定价。

文件转录降价25%,实时转录单独定价,再加上结构化的上下文提示能力——这不仅是一次技术升级,更是一次商业模式的精细化运营。对于开发者而言,选择变多了,成本也更可控了;对于OpenAI而言,API收入的“收割”方式,正变得越来越精准。

语音AI的战场,正在从“谁更准”走向“谁更懂场景”。


Copyright 2015-2023
山西扶摇而上商业管理集团有限公司        版权所有
晋ICP备15006409号     晋公网安备14019202000635号