中文

VCA:用于长视频理解的视频好奇智能体

计算机视觉与模式识别 2025-03-11 v2 人工智能

摘要

长视频理解因其时间复杂性和低信息密度而面临独特挑战。近期的工作通过采样大量帧或使用LLM结合辅助工具来解决这一任务,这两种方式均导致高昂的计算成本。在本工作中,我们引入了一种具有自探索能力的由好奇心驱动的视频智能体,称为VCA。基于VLM构建,VCA自主导航视频片段并高效地建立对复杂视频序列的全面理解。VCA不直接采样帧,而是采用树搜索结构来探索视频片段并收集帧。VCA不依赖外部反馈或奖励,而是利用VLM自生成的内在奖励来引导其探索,使其能够捕获对推理最关键的信息。在多个长视频基准上的实验结果证明了我们方法在有效性和效率上的优越性。

关键词

引用

@article{arxiv.2412.10471,
  title  = {VCA: Video Curious Agent for Long Video Understanding},
  author = {Zeyuan Yang and Delin Chen and Xueyang Yu and Maohao Shen and Chuang Gan},
  journal= {arXiv preprint arXiv:2412.10471},
  year   = {2025}
}