面向数千种语言的稳健语音表征学习
计算与语言
2024-07-03 v2 人工智能
声音
音频与语音处理
摘要
自监督学习(SSL)通过降低对标签数据的需求,帮助将语音技术扩展到更多语言。然而,模型仍远远不足以支持全球7000多种语言。我们提出XEUS(Cross-lingual Encoder for Universal Speech),在4057种语言上训练,数据量超过100万小时,将SSL模型的语言覆盖范围扩展了4倍。我们将来自现有公开语料库的100万小时语音数据与新建的4057种语言、7400多小时语音数据相结合。新建语料库将对外公开。为处理多语言语音数据的多样化条件,我们在通常的SSL掩码预测方法基础上引入了新的消混目标,以提升鲁棒性。我们在多个基准上评估了XEUS,表明其在各种任务上均优于或与当前SOTA SSL模型表现相当。XEUS在ML-SUPERB基准上取得新纪录:相较于MMS 1B和w2v-BERT 2.0 v2,分别提升了0.8%和4.4%,尽管其参数数量或预训练数据较少。检查点、代码和数据可在https://www.wavlab.org/activities/2024/xeus/获取。
引用
@article{arxiv.2407.00837,
title = {Towards Robust Speech Representation Learning for Thousands of Languages},
author = {William Chen and Wangyou Zhang and Yifan Peng and Xinjian Li and Jinchuan Tian and Jiatong Shi and Xuankai Chang and Soumi Maiti and Karen Livescu and Shinji Watanabe},
journal= {arXiv preprint arXiv:2407.00837},
year = {2024}
}
备注
Updated affiliations; 20 pages