MASR: 基于多模态分层注意力聚焦的自反思推理用于智能体视频理解
计算机视觉与模式识别
2025-04-29 v2 人工智能
摘要
尽管在快速发展的大模型时代,视频理解仍是一个极具挑战性的任务。与文本或图像不同,视频通常包含更多信息且存在冗余,需要大型模型在全局层面properly分配注意力以进行全面和准确的理解。为此,我们提出了一种用于智能体视频理解的多模态分层注意力聚焦自反思推理(MASR)框架。其关键创新点在于能够检测和优先考虑与查询高度相关的视频片段。首先,MASR实现了多模态粗到细相关感知(MCRS),增强了获取的上下文信息与查询之间的相关性。其次,MASR采用扩张时间扩展(DTE)以减轻在通过MCRS选取的关注帧中提取语义信息时可能遗漏关键细节的风险。通过在自反思推理过程中反复应用MCRS和DTE,MASR能够适应性地调整注意力以提取高度查询相关的上下文,从而提高响应准确性。在EgoSchema数据集上,MASR比以前的领先方法实现了显著的5%性能提升。在Next-QA和IntentQA数据集上,它分别超过了最先进的标准0.2%和0.3%。在包含长期视频的Video-MME数据集上,MASR也优于其他智能体方法。
引用
@article{arxiv.2504.17213,
title = {MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding},
author = {Shiwen Cao and Zhaoxing Zhang and Junming Jiao and Juyi Qiao and Guowen Song and Rong Shen and Xiangbing Meng},
journal= {arXiv preprint arXiv:2504.17213},
year = {2025}
}