中文

Speech LLM 对语音障碍鲁棒性评估基准——VocalBench-DF

音频与语音处理 2025-10-20 v1

摘要

虽然语音大语言模型(Speech-LLMs)在许多应用中表现出强大的性能,但其鲁棒性却在严格测试中受到忽视,尤其是对语音障碍的鲁棒性。现有评估常依赖理想化输入,忽略常见的语音障碍,尤其是与帕金森病等疾病相关的障碍。本工作旨在探讨当前Speech-LLMs在与有语音障碍用户交互时是否能维持性能。为此,我们引入VocalBench-DF(语音障碍评估框架),用于系统化评估跨多维分类别的语音障碍。我们的评估覆盖22个主流Speech-LLMs,发现性能显著下降,表明其实际应用就绪性有限。进一步分析识别出音素级处理和长上下文建模是导致这些失败的主要瓶颈。加强来自组件和管道的识别与推理能力可显著提升鲁棒性。这些发现凸显了有急迫需要新方法来改善语音障碍处理,构建真正包容性的Speech-LLMs的迫切性。

关键词

引用

@article{arxiv.2510.15409,
  title  = {Towards Blind Data Cleaning: A Case Study in Music Source Separation},
  author = {Azalea Gui and Woosung Choi and Junghyun Koo and Kazuki Shimada and Takashi Shibuya and Joan Serrà and Wei-Hsiang Liao and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2510.15409},
  year   = {2025}
}

备注

Submitted to IEEE ICASSP 2026