AVATAAR:基于时空自适应对齐与推理的视频问答智能体
计算机视觉与模式识别
2026-04-13 v1
摘要
随着视频内容的日益普及,有效理解和回答关于长时段视频的问题已对诸多应用至关重要。虽然大型视觉语言模型(LVLMs)已提升性能,但常面临对细致查询的挑战,这类查询要求进行全面理解和详细分析。为克服这些障碍,我们提出AVATAAR,一个模块化且可解释的框架,融合全局和局部视频上下文,以及预检索思考智能体(Pre Retrieval Thinking Agent)和重新思考模块(Rethink Module)。AVATAAR创建持久的全局摘要,并在重新思考模块与预检索思考智能体之间建立反馈回路,使系统能够根据部分答案细化检索策略,复制人类式的迭代推理。 在CinePile基准上,AVATAAR相较于基线实现了显著提升,时序推理提升5.6%、技术查询提升5%、主题问题提升8%和叙事理解提升8.2%。我们的实验表明,每个模块对整体性能都有积极贡献,反馈回路对适应性至关重要。这些发现凸显了AVATAAR在提升视频理解能力方面的有效性。最终,AVATAAR为长时段视频问答(QA)提供了可扩展的解决方案,融合了准确性、可解释性和可扩展性。
引用
@article{arxiv.2511.15578,
title = {AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning},
author = {Urjitkumar Patel and Fang-Chun Yeh and Chinmay Gondhalekar},
journal= {arXiv preprint arXiv:2511.15578},
year = {2026}
}
备注
Accepted in the 5th IEEE Big Data Workshop on Multimodal AI (MMAI 2025), Dec 8-11, Macau, China, 2025 (Preprint Copy)