2026-03-18
做AI语音助手研发的人都懂,欧美语言的模型训练顺风顺水,可一碰到非洲语言就彻底卡壳,核心原因就一个没训练数据。别说大规模标注语料,就连基础测试的标准化数据都寥寥无几。
为了解决这个难题,谷歌直接开源了1400多小时的ASR、TTS高质量数据WAXAL,覆盖24种撒哈拉以南非洲语言。

开源地址:https://huggingface.co/datasets/google/WAXAL
撒哈拉以南非洲有两千多种语言、13亿多人口,可因缺乏大规模高质量语音语料库,绝大多数本土语言没有成熟的ASR和TTS系统,数字鸿沟格外刺眼。
更何况非洲语言本身极具特殊性,声调区分严苛、词法结构复杂,日常交流还常出现语码转换,常规语音模型根本无法适配,没有基础数据,后续的训练、评估、适配全是空谈。
此前并非没有相关的多语言语音数据集尝试,比如Common Voice众包了19000多小时录音、FLEURS覆盖102种语言,但这些资源的重心全在英语、汉语等高资源语言,非洲语言占比微乎其微。
专门针对撒哈拉以南非洲语言的数据集更是惨不忍睹,要么规模过小,要么覆盖语言极少。
TTS相关资源更是稀缺,即便表现不错的BibleTTS,也仅覆盖6种语言、80多小时数据,对模型训练而言杯水车薪。

谷歌开源的WAXAL由ASR和TTS两大数据集构成,二者定位不同、采集方式各异,却都做到了规模和质量的双重突破。
其中ASR数据集占1.7TB,覆盖19种非洲语言,拥有1250小时带转录文本的自然语音、224767个语音实例,是目前非洲语言领域天花板级别的ASR数据。
为捕捉最真实的日常口语,研发团队摒弃脚本朗读,采用图像提示法,让说话人用母语描述50多个主题的图片,引导出自然多样的表达。
录音也无需专业环境,室内、室外、办公室均可,单段时长不低于15秒,同时兼顾性别平衡和年龄分布,让模型能适配不同人群的说话特点。
转录环节由当地专业语言专家完成,按本地脚本或英文字母精准转写,且经过多轮质量检测,剔除个人信息,还附带年龄、性别、录制环境等丰富元数据,为模型训练提供多维度支撑。

TTS数据集则占99GB,覆盖17种非洲语言,拥有180小时高保真单说话人录音、17660个语音实例,相较以往稀缺的非洲TTS数据实现跨越式提升。
作为语音合成的专属数据,它全程走标准化路线,为10种核心语言打造各含108500个单词的语音平衡脚本,覆盖语言核心语音特征。

还招募72名本土配音演员,男女各36人,在专业类工作室环境完成录音,最大程度降低背景噪音,每位演员录制16小时干净剪辑音频,保证数据的高保真和统一性。
同时附带说话人ID、性别等元数据,方便研发者训练不同风格的合成模型。值得一提的是,24种语言中,部分同时拥有ASR和TTS数据,部分单独配套,精准满足不同语言的研发需求。
登录/注册后继续阅读
立即登录/注册 >