2026-07-29
按住下方图标,点击小程序
免费领取AI学习资料、精选提示词

你们有没有遇到过这样的场景,开会录音两小时,回去整理纪要整理到怀疑人生?
或者采访素材堆成山,逐字逐句听写到深夜?别急,音频转录API可能就是你要找的那个救星。
而OpenAI刚刚又推出了两款新模型分别是GPT-Transcribe和GPT-Live-Transcribe,进一步提升语音转文字体验。
GPT-Transcribe是专门为处理已经录好的音频文件设计的,也就是我们常说的离线转录,特别适合那种批量的、不需要立刻出结果的任务,稳扎稳打准确率高。
GPT-Live-Transcribe则是为低延迟实时转录量身定做的,追求的就是一个快字,适合直播字幕或者实时会议记录这种场景。

这两款新模型比起前辈,进步可不是一点半点。它们对上下文的理解能力更强了,面对真实世界的各种口音、不同语言混杂的场景都能从容应对。
哪怕录音背景噪音很大,或者说话人嘴里蹦出专业术语、数字甚至很短的短语,都能识别得清清楚楚,这在以前可是很容易翻车的环节。
至于早期的whisper-1,现在更多是为了兼容老项目而保留的,新项目建议直接上这俩新秀。
说到音频文件格式,支持得挺全面的,mp3、mp4、mpeg、mpga、m4a、wav、webm都没问题。不过有个硬性限制,单文件不能超过25MB。
超过这个体积咋办?后面我会细说分片处理的技巧。另外还有个小建议:音频采样率最好设置在16kHz左右,单声道效果最佳。
别想着上传高码率无损大文件,既占带宽又容易超限,得不偿失。
现在来看看具体怎么调用。最简单的方式就是发一个请求,把音频文件扔过去,指定模型名称就完事了。
这里有个小窍门,如果提前知道音频是什么语言,把语言代码加上去,比如中文就传zh,英文就传en,识别准确率会明显提升。
还有个参数叫temperature,听起来挺专业的,其实就是个随机性调节器。设为0输出最稳定,录音质量差的时候可以适当调高一点。

输出格式这块设计得挺贴心的。默认返回JSON,只有纯文本内容,轻量简洁。
如果需要做字幕,可以选srt或vtt格式,时间轴直接嵌入,导入播放器就能用。
最强大的要数verbose_json了,连分段信息、每个句子的起止时间甚至每个单词的时间戳都能给你,二次开发首选这个。
提到时间戳,这个功能真的很实用。想象一下你在做视频字幕,需要精确知道某句话出现在几分几秒,开启详细输出模式就能拿到这些信息。
甚至可以细化到单词级别,对于做语音对齐、剪辑辅助的场景简直是福音。

再说说翻译功能。有时候手头有段法语采访或者日语播客,自己看不懂又找不到翻译,这时候可以调用翻译接口,不管原始音频是什么语言,出来的都是英文文本。
不过要注意,翻译模式不支持手动指定源语言,模型会自动判断。
登录/注册后继续阅读
立即登录/注册 >