对应关联对视频指代表达理解至关重要
计算机视觉与模式识别
2022-08-18 v2
摘要
我们研究视频指代表达理解(REC)问题,其旨在将句子中描述的目标对象定位到视频帧中的视觉区域。尽管近期取得进展,现有方法存在两个问题:1)跨视频帧的定位结果不一致;2)目标对象与上下文对象之间的混淆。为此,我们提出一种新颖的双重对应网络(称为 DCNet),其显式地增强帧间和跨模态两种方式的密集关联。首先,我们旨在为帧内所有现有实例建立帧间相关性。具体而言,我们计算帧间块级余弦相似度以估计密集对齐,然后执行帧间对比学习以在特征空间中将它们映射接近。其次,我们提出建立细粒度块-词对齐,将每个图像块与特定词相关联。由于缺乏此类详细标注,我们也通过余弦相似度预测块-词对应。大量实验表明,我们的 DCNet 在视频和图像 REC 基准上均达到最先进(state-of-the-art, SOTA)性能。此外,我们进行了全面的消融研究和深入分析以探索最优模型设计。值得注意的是,我们的帧间和跨模态对比损失是即插即用功能,适用于任何视频 REC 架构。例如,在 Co-grounding 之上构建,我们在 VID-Sentence 数据集的 [email protected] 上实现了 1.48% 的绝对提升。
引用
@article{arxiv.2207.10400,
title = {Correspondence Matters for Video Referring Expression Comprehension},
author = {Meng Cao and Ji Jiang and Long Chen and Yuexian Zou},
journal= {arXiv preprint arXiv:2207.10400},
year = {2022}
}
备注
Accepted by ACM MM 2022