中文

LongAudio-RAG:基于事件 grounding 的多小时长音频问答

音频与语音处理 2026-03-10 v3 人工智能 机器学习

摘要

长时长音频在工业和消费场景中日益常见,但审阅多小时录音文件往往不可行,这促使开发能够以精确的时间锚定和最小幻觉回答自然语言查询的系统。现有音频语言模型虽有希望,但由于上下文长度限制,长音频问答仍面临困难。我们引入 LongAudio-RAG(LA-RAG),一种混合框架,通过检索而非原始音频的带时间戳的声学事件检测来为大语言模型输出提供依据。将多小时流转换为结构化事件记录存储于 SQL 数据库中,在推理阶段系统解析自然语言时间参考、分类意图、仅检索相关事件,并据此受约束的证据生成答案。为评估性能,我们构建了由拼接保留时间戳的录音组成的合成长音频基准,通过模板化问答对生成检测、计数和摘要任务。最后,我们在混合边缘-云环境中部署了该系统,其中音频 grounding 模型运行于物联网级硬件上,而 LLM 托管于 GPU 服务器。该架构实现了边缘端的低延迟事件提取和云端的高质量语言推理。实验表明,结构化、事件级检索在准确率上显著优于普通检索增强生成(RAG)或文本到 SQL 方法。

关键词

引用

@article{arxiv.2602.14612,
  title  = {LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio},
  author = {Naveen Vakada and Kartik Hegde and Arvind Krishna Sridhar and Yinyi Guo and Erik Visser},
  journal= {arXiv preprint arXiv:2602.14612},
  year   = {2026}
}