中文

什么?评估大型音频语言模型中的对话修复

计算与语言 2026-01-21 v1

摘要

大型音频语言模型(LALMs)在语音问答(QA)中展现出了优异的性能,现有的评估主要集中在答案准确性以及对声学扰动的鲁棒性上。然而,此类评估隐含地假设语音输入在语义上是可回答的,而在现实交互中,当缺失关键信息时,这一假设往往不成立。在本研究中,我们引入了一种具备修复意识的评估设置,明确区分可回答与不可回答的音频输入。我们将可回答性定义为输入本身的属性,并使用语义-声学掩码协议构建了配对的评估条件。基于此设置,我们提出了可回答性意识与修复(EAR)分数,这是一种非补偿性指标,联合评估可回答条件下的任务能力与不可回答条件下的修复行为。在两个语音QA基准上跨多种LALMs的实验揭示了答案准确性与对话可靠性之间的一致差距:尽管许多模型在输入可回答时表现良好,但大多数模型未能识别语义上的不可回答性并启动适当的对话修复。这些发现揭示了当前以准确性为中心的评估实践的局限性,并推动了将不可回答输入视为修复与持续交互线索的可靠性评估。

关键词

引用

@article{arxiv.2601.12973,
  title  = {Pardon? Evaluating Conversational Repair in Large Audio-Language Models},
  author = {Shuanghong Huang and Jinlei Xu and Youchao Zhou and Yanghao Zhou and Xuan Zhao and Chong Feng and Wenxuan Zhang},
  journal= {arXiv preprint arXiv:2601.12973},
  year   = {2026}
}