中文

OmniRAG-Agent:面向低资源长时音视频问答的智能体化全模态推理

计算与语言 2026-03-31 v4

摘要

长时程全模态问答通过对文本、图像、音频和视频进行推理来回答问题。尽管近期在OmniLLMs方面取得了进展,但低资源长时音视频问答仍面临高成本的稠密编码、弱的细粒度检索、受限的主动规划以及缺乏明确的端到端优化等问题。为此,我们提出OmniRAG-Agent,一种用于预算受限长时音视频推理的智能体化全模态问答方法。它构建了一个图像-音频检索-增强生成模块,使OmniLLM能够从外部数据库中检索出短小且相关的帧和音频片段。此外,它使用智能体循环进行规划、跨轮调用工具,并整合检索证据来回答复杂查询。进一步,我们应用组相对策略优化(group relative policy optimization)来联合提高工具使用和答案质量。实验在OmniVideoBench、WorldSense和Daily-Omni上表明,OmniRAG-Agent在低资源设置下 consistently 超过先前方法,取得了强大的成绩,且各组件的消融实验验证了其有效性。

关键词

引用

@article{arxiv.2602.03707,
  title  = {OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering},
  author = {Yifan Zhu and Xinyu Mu and Tao Feng and Zhonghong Ou and Yuning Gong and Haoran Luo},
  journal= {arXiv preprint arXiv:2602.03707},
  year   = {2026}
}