基于视听实体凝聚和智能体搜索的层次化长视频理解
计算机视觉与模式识别
2026-03-25 v2 人工智能
信息检索
摘要
由于极长的上下文窗口,长视频理解对视觉-语言模型提出了重大挑战。现有的解决方案依赖于朴素的切块策略和检索增强生成,通常会遭受信息碎片化和全局连贯性丧失的问题。我们提出了 HAVEN,一个用于长视频理解的统一框架,通过集成视听实体凝聚和层次化视频索引与智能体搜索,实现连贯且全面的推理。首先,我们通过整合视觉和听觉流中的实体级表示来保持语义一致性,同时将内容组织成一个涵盖全局摘要、场景、片段和实体级别的结构化层次。然后,我们采用智能体搜索机制,实现跨这些层的动态检索和推理,从而促进连贯的叙事重建和细粒度实体跟踪。大量实验表明,我们的方法实现了良好的时间连贯性、实体一致性和检索效率,在 LVBench 上以 84.1% 的整体准确率建立了新的最先进水平。值得注意的是,它在具有挑战性的推理类别中取得了出色的性能,达到 80.1%。这些结果突显了结构化、多模态推理对于全面且上下文一致地理解长视频的有效性。
引用
@article{arxiv.2601.13719,
title = {Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search},
author = {Xinlei Yin and Xiulian Peng and Xiao Li and Zhiwei Xiong and Yan Lu},
journal= {arXiv preprint arXiv:2601.13719},
year = {2026}
}
备注
Accepted by CVPR2026