OpenAI语音转文字全攻略:从基础用法到Prompt优化

2026-07-29

按住下方图标,点击小程序

免费领取AI学习资料、精选提示词

图片

你们有没有遇到过这样的场景开会录音两小时,回去整理纪要整理到怀疑人生?

或者采访素材堆成山,逐字逐句听写到深夜?别急,音频转录API可能就是你要找的那个救星。

OpenAI刚刚又推出了两款新模型分别是GPT-TranscribeGPT-Live-Transcribe,进一步提升语音转文字体验。

GPT-Transcribe是专门为处理已经录好的音频文件设计的,也就是我们常说的离线转录,特别适合那种批量的、不需要立刻出结果的任务,稳扎稳打准确率高。

GPT-Live-Transcribe则是为低延迟实时转录量身定做的,追求的就是一个快字,适合直播字幕或者实时会议记录这种场景。

这两款新模型比起前辈,进步可不是一点半点。它们对上下文的理解能力更强了,面对真实世界的各种口音、不同语言混杂的场景都能从容应对。

哪怕录音背景噪音很大,或者说话人嘴里蹦出专业术语、数字甚至很短的短语,都能识别得清清楚楚,这在以前可是很容易翻车的环节。

至于早期的whisper-1,现在更多是为了兼容老项目而保留的,新项目建议直接上这俩新秀。

说到音频文件格式,支持得挺全面的,mp3mp4mpegmpgam4awavwebm都没问题。不过有个硬性限制,单文件不能超过25MB

超过这个体积咋办?后面我会细说分片处理的技巧。另外还有个小建议:音频采样率最好设置在16kHz左右,单声道效果最佳。

别想着上传高码率无损大文件,既占带宽又容易超限,得不偿失。

现在来看看具体怎么调用。最简单的方式就是发一个请求,把音频文件扔过去,指定模型名称就完事了。

这里有个小窍门,如果提前知道音频是什么语言,把语言代码加上去,比如中文就传zh,英文就传en,识别准确率会明显提升。

还有个参数叫temperature,听起来挺专业的,其实就是个随机性调节器。设为0输出最稳定,录音质量差的时候可以适当调高一点。

输出格式这块设计得挺贴心的。默认返回JSON,只有纯文本内容,轻量简洁。

如果需要做字幕,可以选srtvtt格式,时间轴直接嵌入,导入播放器就能用。

最强大的要数verbose_json了,连分段信息、每个句子的起止时间甚至每个单词的时间戳都能给你,二次开发首选这个。

提到时间戳,这个功能真的很实用。想象一下你在做视频字幕,需要精确知道某句话出现在几分几秒,开启详细输出模式就能拿到这些信息。

甚至可以细化到单词级别,对于做语音对齐、剪辑辅助的场景简直是福音。

再说说翻译功能。有时候手头有段法语采访或者日语播客,自己看不懂又找不到翻译,这时候可以调用翻译接口,不管原始音频是什么语言,出来的都是英文文本。

不过要注意,翻译模式不支持手动指定源语言,模型会自动判断。

确定要退出登录吗?
确定 取消