中文

基于注意力引导的证据 grounding 用于口语问答

计算与语言 2026-03-19 v2 人工智能

摘要

口语问答(Spoken Question Answering, Spoken QA)是一个具有挑战性的跨模态问题:在避免级联 ASR 系统固有的延迟和误差传播的前提下,有效地将声学查询与文本知识对齐。本文引入注意力引导证据 grounding(Attention-guided Evidence Grounding, AEG),这是一种新颖的端到端框架,利用 Speech 大语言模型(SpeechLLM)内部的跨模态注意力机制,显式地在模型潜在空间中定位和 grounding 关键证据。为解决预训练模型中注意力分布过于扩散的问题,我们提出了基于证据聚焦的学习(Learning to Focus on Evidence, LFE),这是一种监督式微调范式,通过校准模型的注意力机制来区分与查询相关的片段与无关上下文。在 SQuAD、HotpotQA 和 MuSiQue 上的实验表明,AEG 减少了幻觉现象,实现了显著的效率提升,超越了大规模级联基线系统(Whisper-Large-v3 + Reranker),同时将推理延迟降低约 62%。

关键词

引用

@article{arxiv.2603.16292,
  title  = {Attention-guided Evidence Grounding for Spoken Question Answering},
  author = {Ke Yang and Bolin Chen and Yuejie Li and Yueying Hua and Jianhao Nie and Yueping He and Bowen Li and Chengjun Mao},
  journal= {arXiv preprint arXiv:2603.16292},
  year   = {2026}
}

备注

Accepted to ICME 2026