中文

HiCrew: 通过问题感知的多智能体协作实现长视频理解的分层推理

人工智能 2026-04-24 v1

摘要

长视频理解仍然面临普遍存在的时空冗余和跨越长时间范围的复杂叙事依赖性的根本挑战。虽然最近的结构化表示方法能有效压缩视觉信息,但它们常常牺牲对因果推理至关重要的时间连贯性。同时,现有的多智能体框架通过僵化、预定义的工作流运行,无法根据特定问题的需求调整其推理策略。在本文中,我们介绍HiCrew,一个分层多智能体框架,通过三个核心贡献来解决这些局限性。首先,我们提出一种混合树结构,利用镜头边界检测来保留时间拓扑结构,同时在语义连贯的片段内执行相关性引导的分层聚类。其次,我们开发了一种问题感知字幕机制,合成意图驱动的视觉提示以生成面向精确性的语义描述。第三,我们集成一个规划层,通过根据问题复杂性自适应地选择角色和执行路径来动态编排智能体协作。在EgoSchema和NExT-QA上的大量实验验证了我们方法的有效性,展示了在多样化问题类型上的强劲性能,特别是在受益于我们分层结构保持设计的时间和因果推理任务中取得了显著提升。

关键词

引用

@article{arxiv.2604.21444,
  title  = {HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration},
  author = {Yuehan Zhu and Jingqi Zhao and Jiawen Zhao and Xudong Mao and Baoquan Zhao},
  journal= {arXiv preprint arXiv:2604.21444},
  year   = {2026}
}