中文

PRiSM:语音模型中音素实现的基准测试

计算与语言 2026-01-21 v1 声音

摘要

音素识别(PR)是跨语言语音处理和语音学分析中语言无关建模的原子接口。尽管在开发音素识别系统方面付出了长期努力,但当前的评估仅衡量表面级的转录准确性。我们引入了PRiSM,这是首个开源基准测试,旨在通过对音素识别系统的内在和外在评估来揭示其感知盲点。PRiSM标准化了基于转录的评估,并通过转录和表征探针评估其在临床、教育和多语言环境中的下游实用性。我们发现,训练期间多样化的语言暴露是音素识别性能的关键,编码器-CTC模型最为稳定,并且专门的音素识别模型仍然优于大型音频语言模型。PRiSM发布了代码、配方和数据集,以推动该领域朝着具有鲁棒语音能力的多语言语音模型发展:https://github.com/changelinglab/prism。

关键词

引用

@article{arxiv.2601.14046,
  title  = {PRiSM: Benchmarking Phone Realization in Speech Models},
  author = {Shikhar Bharadwaj and Chin-Jou Li and Yoonjae Kim and Kwanghee Choi and Eunjung Yeo and Ryan Soh-Eun Shim and Hanyu Zhou and Brendon Boldt and Karen Rosero Jacome and Kalvin Chang and Darsh Agrawal and Keer Xu and Chao-Han Huck Yang and Jian Zhu and Shinji Watanabe and David R. Mortensen},
  journal= {arXiv preprint arXiv:2601.14046},
  year   = {2026}
}