VideoMiner:通过基于树的组相对策略优化迭代 grounding 超长视频关键帧
计算机视觉与模式识别
2025-10-08 v1 人工智能
摘要
理解多模态大语言模型 (MM-LLM) 的超长视频丰富了以人为中心的人工智能应用的格局。然而,对于 LLM 的端到端视频理解,均匀采样视频帧会导致 LLM 被大量无关信息所淹没。现有的层次化关键帧提取方法虽提高了视频理解准确性,但仍面临两个关键挑战:1) 如何消除超长视频中大量冗余信息的干扰?2) 如何在准确识别关键帧的同时动态适应复杂的层次结构?为此,我们提出了 VideoMiner,通过迭代分割、描述和聚类超长视频,形成层次化树结构。VideoMiner 从长视频到事件再到帧的过程保留了时间一致性,有效解决了第一个挑战。为了精确定位关键帧,我们引入 T-GRPO,这是一种用于 VideoMiner 的基于树的组相对策略优化强化学习方法。T-GRPO 专为树结构设计,整合了事件层面的时空信息,并受问题引导,从而解决了第二个挑战。我们在所有超长视频理解任务中实现了卓越的性能,并发现了若干有趣的见解。我们提出的 T-GRPO 意外激励模型自发生成推理链。此外,设计的树生长啮刺动态调整扩展深度,获得了准确性和效率的提升。代码已公开于 https://github.com/caoxinye/VideoMiner。
引用
@article{arxiv.2510.06040,
title = {VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization},
author = {Xinye Cao and Hongcan Guo and Jiawen Qian and Guoshun Nan and Chao Wang and Yuqi Pan and Tianhao Hou and Xiaojuan Wang and Yutong Gao},
journal= {arXiv preprint arXiv:2510.06040},
year = {2025}
}
备注
Accepted by ICCV 2025