中文

对话语音揭示 SpeechLLM 骨干模型的结构鲁棒性缺陷

计算与语言 2026-03-06 v2 人工智能 音频与语音处理

摘要

LLMs 作为 SpeechLLMs 的骨干模型,但其在自发性对话输入上的行为仍鲜为人知。对话语音中普遍存在不流利现象——插入语、编辑和插入括号——这些在预训练所用的书面语料中极为罕见。由于黄金标准的不流利现象移除是一个仅删除任务,因此它可作为受控探测手段,用于判断模型是进行忠实的结构修复还是偏向性重解释。我们使用 DRES 评估框架,对专有和开源 LLM 跨架构和规模进行了评估。结果表明,模型性能聚类为稳定的精确率-召回率区间,反映了不同的编辑策略。值得注意的是,推理模型系统性地过度删除流畅内容,暴露出偏向语义抽象而非结构保真的偏差。虽然微调达到了 SOTA 结果,但损害了泛化能力。我们的发现表明,对语音的鲁棒性由特定的训练目标所塑造。

关键词

引用

@article{arxiv.2509.20321,
  title  = {Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones},
  author = {Maria Teleki and Sai Janjur and Haoran Liu and Oliver Grabner and Ketan Verma and Thomas Docog and Xiangjue Dong and Lingfeng Shi and Cong Wang and Stephanie Birkelbach and Jason Kim and Yin Zhang and Éva Székely and James Caverlee},
  journal= {arXiv preprint arXiv:2509.20321},
  year   = {2026}
}