中文

EvoGround:用于视频时间定位的自演化视频代理

计算机视觉与模式识别 2026-05-14 v1

摘要

视频时间定位 (VTG) 将未剪辑视频和自然语言查询作为输入,并定位最匹配查询的时序时刻。现有方法依赖需要高昂人工标注的大型任务特定数据集。我们引入 EvoGround,一个由两个相互自演化代理组成的框架, proposer 和 solver,能够从原始视频中学习时间定位,而无需任何人工标注数据。proposer 从原始视频中生成查询-时刻对,而 solver 学习将其定位并反馈信号以改进 proposer。通过这一自我强化的强化学习循环,两个代理从相同的 backbone 初始化,并在迭代中相互改进。在 2500 条无标签视频上训练,EvoGround 跨越多个 VTG 基准测试匹配或超越完全监督模型,同时作为无手动标签的领先细粒度视频描述器脱颖而出。

关键词

引用

@article{arxiv.2605.13803,
  title  = {EvoGround: Self-Evolving Video Agents for Video Temporal Grounding},
  author = {Minjoon Jung and Byoung-Tak Zhang and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:2605.13803},
  year   = {2026}
}

备注

Project page: https://minjoong507.github.io/projects/EvoGround/