让我完成我的句子:基于全面文本理解的时间视频 grounding
计算机视觉与模式识别
2024-10-18 v1
摘要
视频时间 grounding (VTG) 的目标是识别视频片段中与文本查询相匹配的视觉帧。最近的 VTG 研究采用跨注意力机制将视觉帧和文本查询作为 individual token 序列进行关联。然而,这些方法忽略了一个关键方面:对查询句子的全面理解。模型可能捕捉到 individual 词语 token 与任意视觉帧之间的关联,但可能错失全局语义。为此,我们提出两种主要贡献:(1) 融合全面文本信息的视觉帧级门控机制;(2) 用于学习查询与相关帧之间细粒度关联的跨模态对齐损失。结果,我们对 individual 词语 token 的影响进行正则化,抑制无关视觉帧。我们展示了该方法在 VTG 基准测试中超越最新方法,表明全面文本理解引导模型聚焦于视频中语义重要部分。
引用
@article{arxiv.2410.13598,
title = {Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding},
author = {Jongbhin Woo and Hyeonggon Ryu and Youngjoon Jang and Jae Won Cho and Joon Son Chung},
journal= {arXiv preprint arXiv:2410.13598},
year = {2024}
}
备注
Accepted by ACMMM 24