从博弈视角重新思考弱监督视频时序定位
计算机视觉与模式识别
2026-05-27 v1 人工智能
摘要
本文解决了弱监督视频时序定位这一具有挑战性的任务。现有方法通常基于时刻提案选择框架,利用对比学习和重构范式来对预定义的时刻提案进行评分。尽管它们取得了显著进展,但我们认为其现有框架忽略了两个不可或缺的问题:1)粗粒度的跨模态学习:先前方法仅捕获与查询的全局视频级对齐,未能建模视频帧与查询词之间的细粒度一致性,从而无法精确定位时刻边界。2)复杂的时刻提案:其性能严重依赖于提案的质量,而提案的选择既耗时又复杂。为此,在本文中,我们首次尝试从一个新颖的博弈视角来处理此任务,该视角通过多样化的粒度和灵活的组合,有效地学习每个视觉-语言对之间的不确定关系,以实现多级跨模态交互。具体来说,我们创造性地将每个视频帧和查询词建模为多元合作博弈中的博弈参与者,以学习它们对跨模态相似度分数的贡献。通过博弈论交互量化联盟内帧-词合作的趋势,我们能够评估帧与词之间所有不确定但可能的对应关系。最后,我们不再使用时刻提案,而是利用学习到的查询引导的逐帧分数来进行更好的时刻定位。实验表明,我们的方法在Charades-STA和ActivityNet Caption数据集上均取得了优越的性能。
引用
@article{arxiv.2605.26441,
title = {Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective},
author = {Xiang Fang and Zeyu Xiong and Wanlong Fang and Xiaoye Qu and Chen Chen and Jianfeng Dong and Keke Tang and Pan Zhou and Yu Cheng and Daizong Liu},
journal= {arXiv preprint arXiv:2605.26441},
year = {2026}
}
备注
Published in ECCV 2024