中文

ACES:面向语音识别的音调子空间用于耦合、解释与压力测试

声音 2026-03-10 v2 人工智能 音频与语音处理

摘要

语音识别系统在不同音调上表现出持续的性能差距,但这些差距是反映出表面偏见还是深层结构性脆弱性尚不明确。我们引入ACES,通过从语音识别表示中提取音调判别性子空间,将对抗攻击限制在这些子空间上,并测试是否通过去除它们来改善公平性。在Wav2Vec2-base模型上使用七种音调,肉眼不可见的扰动(约60 dB SNR)沿着音调子空间放大WER差距将近50%(21.3->31.8个百分点),超过随机子空间控制组;置换标签测试确认了对真实音调结构的特异性。部分去除子空间会恶化WER和差距,揭示了音调判别特征与识别关键特征之间的深层纠缠。因此,ACES将音调子空间定位为强大的公平性审计工具,而不仅仅是简单的消除杠杆。

关键词

引用

@article{arxiv.2603.03359,
  title  = {ACES: Accent Subspaces for Coupling, Explanations, and Stress-Testing in Automatic Speech Recognition},
  author = {Swapnil Parekh},
  journal= {arXiv preprint arXiv:2603.03359},
  year   = {2026}
}