中文

通用电话识别的实证配方

计算与语言 2026-04-02 v1 机器学习 声音 音频与语音处理

摘要

电话识别(PR)是多语言和低资源语音处理任务的关键使能器,但稳健的性能仍显得笨拙。高度优化的英语为中心的模型难以跨语言推广,而多语言模型则未能充分利用预训练表示。此外,数据规模、架构和训练目标如何贡献于多语言 PR 仍不明确。我们提出 PhoneticXEUS -- 采用大规模多语言数据训练,实现在多语言(PFER 17.7%)和加重英语语音(PFER 10.6%)上的状态-of-the-art 性能。通过在统一方案下进行受控消除实验,我们在 100 多个语言上进行评估,实证确立了我们的训练配方并量化了 SSL 表示、数据规模和损失目标的影响。此外,我们分析了不同语言族、加重语音和语音要素之间的错误模式。所有数据和代码均已公开释放。

关键词

引用

@article{arxiv.2603.29042,
  title  = {An Empirical Recipe for Universal Phone Recognition},
  author = {Shikhar Bharadwaj and Chin-Jou Li and Kwanghee Choi and Eunjung Yeo and William Chen and Shinji Watanabe and David R. Mortensen},
  journal= {arXiv preprint arXiv:2603.29042},
  year   = {2026}
}

备注

Submitted to Interspeech 2026. Code: https://github.com/changelinglab/PhoneticXeus