基于注意力引导的证据 grounding 用于口语问答
计算与语言
2026-03-19 v2 人工智能
摘要
口语问答(Spoken Question Answering, Spoken QA)是一个具有挑战性的跨模态问题:在避免级联 ASR 系统固有的延迟和误差传播的前提下,有效地将声学查询与文本知识对齐。本文引入注意力引导证据 grounding(Attention-guided Evidence Grounding, AEG),这是一种新颖的端到端框架,利用 Speech 大语言模型(SpeechLLM)内部的跨模态注意力机制,显式地在模型潜在空间中定位和 grounding 关键证据。为解决预训练模型中注意力分布过于扩散的问题,我们提出了基于证据聚焦的学习(Learning to Focus on Evidence, LFE),这是一种监督式微调范式,通过校准模型的注意力机制来区分与查询相关的片段与无关上下文。在 SQuAD、HotpotQA 和 MuSiQue 上的实验表明,AEG 减少了幻觉现象,实现了显著的效率提升,超越了大规模级联基线系统(Whisper-Large-v3 + Reranker),同时将推理延迟降低约 62%。
引用
@article{arxiv.2603.16292,
title = {Attention-guided Evidence Grounding for Spoken Question Answering},
author = {Ke Yang and Bolin Chen and Yuejie Li and Yueying Hua and Jianhao Nie and Yueping He and Bowen Li and Chengjun Mao},
journal= {arXiv preprint arXiv:2603.16292},
year = {2026}
}
备注
Accepted to ICME 2026