面向弱监督视频段落定位的联合对齐与回归孪生学习
计算机视觉与模式识别
2024-05-15 v2
摘要
视频段落定位(Video Paragraph Grounding, VPG)是视频-语言理解中的新兴任务,旨在从未剪辑视频中定位具有语义关联和时间顺序的多个句子。然而,现有 VPG 方法严重依赖大量时间标签,获取这些标签既费力又耗时。本文引入并探索弱监督视频段落定位(WSVPG),以消除对时间标注的需求。不同于以往基于多示例学习或重建学习的弱监督定位框架(用于两阶段候选排序),我们提出一种新颖的孪生学习框架,无需时间戳标签即可联合学习跨模态特征对齐与时间坐标回归,实现 WSVPG 的简洁单阶段定位。具体而言,我们设计了孪生定位 Transformer(SiamGTR),由两个权重共享分支组成,用于学习互补监督。增强分支用于在伪视频中直接回归完整段落的时间边界,推理分支则用于捕获顺序引导的特征对应关系,以在正常视频中定位多个句子。大量实验表明,我们的范式具有优越的实用性和灵活性,可实现高效的弱监督或半监督学习,在相同或更强监督条件下优于现有最优方法。
引用
@article{arxiv.2403.11463,
title = {Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding},
author = {Chaolei Tan and Jianhuang Lai and Wei-Shi Zheng and Jian-Fang Hu},
journal= {arXiv preprint arXiv:2403.11463},
year = {2024}
}
备注
Accepted to CVPR 2024. v2: fix a typo in figure 1