M-CIF:用于基于CIF的非自回复语音识别的多尺度对齐
声音
2025-10-28 v1 计算与语言
摘要
连续积分放电(CIF)机制为非自回复(NAR)语音识别提供了有效的对齐方式。该机制在声学特征到目标标记之间创建平滑且单调的映射,实现了在普通话方面与其他NAR方法相当的性能。然而,由于缺乏更细粒度的指导,在如英语和法语等语言中,其稳定性会下降。本文提出了多尺度CIF(M-CIF),通过逐步将字符和音素级别的监督信息蒸馏到子词表示中,以实现多层次对齐,从而增强鲁棒的声学-文本对齐。实验表明,M-CIF在Paraformer基线上降低了WER,尤其在CommonVoice数据集上德语降低了4.21%,法语降低了3.05%。为进一步探讨这些收益,我们定义了音素混淆错误(PE)和与空间相关的分段错误(SE)作为评估指标。对这些指标在不同M-CIF设置下的分析揭示了音素和字符层对增强渐进式CIF对齐至关重要。
引用
@article{arxiv.2510.22172,
title = {M-CIF: Multi-Scale Alignment For CIF-Based Non-Autoregressive ASR},
author = {Ruixiang Mao and Xiangnan Ma and Qing Yang and Ziming Zhu and Yucheng Qiao and Yuan Ge and Tong Xiao and Shengxiang Gao and Zhengtao Yu and Jingbo Zhu},
journal= {arXiv preprint arXiv:2510.22172},
year = {2025}
}