中文

CTC-DRO:用于降低语音识别中语言差异的鲁棒优化

机器学习 2026-01-29 v3 计算与语言 音频与语音处理

摘要

现代深度学习模型常在整体性能上取得高分,但在特定子群上持续表现不佳。群分布鲁棒优化(group DRO)通过最小化最差群损失来解决此问题,但当群损失未能真实反映不同群之间的性能差异时便会失败。这在诸如语音等领域尤为常见,因为广泛使用的连接时序分类(CTC)损失不仅随输入长度而比例缩放,还随语言和声学属性而变化,导致群间损失出现虚假差异。我们提出CTC-DRO,通过平滑群权重更新来防止对持续高损失群的过度强调,同时采用输入长度匹配的批量处理来缓解CTC的比例缩放问题。我们在多语言自动语音识别(ASR)任务上对CTC-DRO进行评估,测试数据来自多样化ML-SUPERB 2.0基准的五个语言集合。CTC-DRO在降低最差语言误差率最高可达47.1%,平均误差率降低最高可达32.9%,持续优于群DRO和CTC基线模型。CTC-DRO在ASR任务中几乎不需要额外计算成本即可实现,而且虽然它源自多语言ASR,却也为在其他类似挑战的领域中减少群间差异提供了潜在可能性。

关键词

引用

@article{arxiv.2502.01777,
  title  = {CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition},
  author = {Martijn Bartelds and Ananjan Nandi and Moussa Koulako Bala Doumbouya and Dan Jurafsky and Tatsunori Hashimoto and Karen Livescu},
  journal= {arXiv preprint arXiv:2502.01777},
  year   = {2026}
}