ZIPA:面向多语言音素识别的高效模型族
计算与语言
2025-05-30 v1 声音
音频与语音处理
摘要
我们提出了 ZIPA,一个高效的语音模型族,推进了跨语言音素识别的 SOTA 性能。我们首先构建了 IPAPack++,一个大规模多语言语音语料库,包含 17,132 小时的归一化音素转录以及一个捕捉未见语言和社会语音学变异的新型评估集。借助大规模训练数据,ZIPA(包括 transducer (ZIPA-T) 和基于 CTC 的 (ZIPA-CR) 变体)利用高效的 Zipformer 骨干网络,以更少的参数量超越了现有的音素识别系统。通过在 11,000 小时伪标注多语言数据上进行 noisy student training 的进一步扩展,带来了进一步的性能提升。尽管 ZIPA 在基准测试中取得了强劲的表现,但误差分析揭示了其在建模社会语音学多样性方面存在的持续局限性,突显了未来研究的挑战。
引用
@article{arxiv.2505.23170,
title = {ZIPA: A family of efficient models for multilingual phone recognition},
author = {Jian Zhu and Farhan Samir and Eleanor Chodroff and David R. Mortensen},
journal= {arXiv preprint arXiv:2505.23170},
year = {2025}
}
备注
ACL 2025 Main