面向稳健 L2 ASR 的专业度感知适应与数据增强
声音
2025-10-14 v1 人工智能
摘要
通用 ASR 对非典型说话者(如 L2 学习者)表现不佳,强化了偏见,限制了在教育和可及性方面的应用。使用 CEFR 分级的 Speak and Improve 语料库,我们表明,对 Whisper 的简单微调虽可降低平均 WER,但同时扩大了差距并对低水平学习者产生不成比例的伤害。为此,我们提出两种策略:(i) 专业度感知多任务学习,联合优化 ASR 与专业度分类;(ii) 针对性增强,对低专业度语音应用频谱遮蔽以抵消不平衡。这些方法可将 WER 降低最高 29.4%(相对),插入/删除错误降低最高 58.6%(相对)。关键的是,尽管数据集严重不平衡反映真实世界的分布,两种策略都能持续缩小专业度差距,推动 L2 学习者实现公平的 ASR。
引用
@article{arxiv.2510.10738,
title = {Proficiency-Aware Adaptation and Data Augmentation for Robust L2 ASR},
author = {Ling Sun and Charlotte Zhu and Shuju Shi},
journal= {arXiv preprint arXiv:2510.10738},
year = {2025}
}
备注
Submitted to ICASSP 2026