面向方言鲁棒语音识别的对比正则化
声音
2026-05-06 v1 机器学习
摘要
基于自监督声学预训练和 CTC 微调的语音识别系统在本土语音方言上表现优异,但对方言变异性仍然敏感。我们研究在 CTC 微调中使用监督对比学习 (SupCon) 作为轻量级、方言不变的辅助目标。无需架构修改或显式方言监督, utterance-level 对比损失对编码器表示进行正则化。在 L2-ARCTIC 数据集上进行的实验显示,在未见方言评估下,SupCon 能在多个预训练编码器上 consistently 降低 WER,降幅可达 25--29%。分析使用 within-transcript 余弦离散度指标表明,SupCon 在方言变异性下促进了更紧凑且稳定的表示几何。总体而言,SupCon 为提高方言鲁棒性提供了一种有效且与模型无关的正则化策略。
引用
@article{arxiv.2605.03297,
title = {Contrastive Regularization for Accent-Robust ASR},
author = {Van-Phat Thai and Aradhya Dhruv and Duc-Thinh Pham and Sameer Alam},
journal= {arXiv preprint arXiv:2605.03297},
year = {2026}
}