Invert4TVG:基于逆转任务保留动作理解能力的时空视频定位框架
人工智能
2026-02-16 v2
摘要
时空视频定位 (TVG) 旨在定位与给定文本查询对应的视频片段,而该查询通常描述人类动作。然而,我们注意到当前方法通常以优化高的时空交并比 (IoU) 为目标,经常难以准确识别或理解视频和查询中所涉及的底层动作,从而降低了这些方法的有效性。为此,我们提出一种新型 TVG 框架,将基于逆转的 TVG 作为辅助目标集成进模型,以保持模型的动作理解能力。我们引入三类源自原始 TVG 标注的逆转 TVG 任务:(1) 动作补全——给定视频片段预测被掩盖的动作词;(2) 动作识别——识别查询所描述的动作;(3) 视频描述——给定视频片段生成包含查询相关动作的描述。这些逆转任务完全源自原始 TVG 任务,并以概率方式在强化学习框架中与之集成。通过设计 carefully 的奖励函数,模型能够保持其动作理解能力,从而提升时空定位的准确性。实验表明,我们的方法在 Charades-STA 数据集上超过最新方法,[email protected] 提升 7.1%。
引用
@article{arxiv.2508.07388,
title = {Invert4TVG: A Temporal Video Grounding Framework with Inversion Tasks Preserving Action Understanding Ability},
author = {Zhaoyu Chen and Hongnan Lin and Yongwei Nie and Fei Ma and Xuemiao Xu and Fei Yu and Chengjiang Long},
journal= {arXiv preprint arXiv:2508.07388},
year = {2026}
}