中文

ChronoForge-RL:基于强化学习的时序锻造以提升视频理解

计算机视觉与模式识别 2025-09-22 v1 人工智能

摘要

当前最先进的视频理解方法通常面临两个关键挑战:(1) 处理密集视频内容时对每帧的计算不可行性;(2) 通过简单均匀抽样策略难以识别语义关键帧。本文提出一种新颖的视频理解框架,称为 ChronoForge-RL,结合 Temporal Apex Distillation (TAD) 与 KeyFrame-aware Group Relative Policy Optimization (KF-GRPO) 以应对上述问题。具体而言,我们引入一种可微的关键帧选择机制,通过三阶段过程系统性地识别语义拐点,以提升计算效率同时保留时序信息。随后,提出两个特定模块以实现有效的时序推理:首先,TAD 利用变异评分、拐点检测和优先级蒸馏等技术选取最具信息性的帧;其次,引入 KF-GRPO,实现基于对比学习的范式,采用显著性增强奖励机制,显式激励模型利用帧内容与时序关系。最终,我们的 ChronoForge-RL 在 VideoMME 上达到 69.1%,在 LVBench 上达到 52.7%,显著优于基线方法,使 7B 参数模型性能接近 72B 参数方案。

关键词

引用

@article{arxiv.2509.15800,
  title  = {ChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video Understanding},
  author = {Kehua Chen},
  journal= {arXiv preprint arXiv:2509.15800},
  year   = {2025}
}

备注

10 pages, 2 figures