减弱视觉与语言偏置的时序语句定位
计算机视觉与模式识别
2022-07-28 v1
摘要
时序语句定位(TSG)是多模态信息检索中一个重要且具有挑战性的任务。尽管以往的TSG方法已取得不错的表现,它们往往捕捉数据集中频繁出现的视频-查询对的选择偏置,而非展现鲁棒的多模态推理能力,尤其对于罕见出现的配对。在本文中,我们研究上述选择偏置问题,并相应提出一个去偏TSG(D-TSG)模型,以过滤并移除视觉与语言两种模态中的负面偏置,从而增强模型泛化能力。具体而言,我们从两个角度缓解该问题:1)特征蒸馏。我们构建了一个多模态去偏分支,首先捕捉视觉与语言偏置,然后应用偏置识别模块显式识别真正的负面偏置并将其从良性多模态表示中移除。2)对比样本生成。我们构造两类负样本,以迫使模型准确学习对齐的多模态语义并进行完整的语义推理。我们将所提模型应用于常见与罕见出现的TSG情形,并在三个基准数据集(ActivityNet Caption、TACoS和Charades-STA)上取得最先进性能,证明了其有效性。
引用
@article{arxiv.2207.13457,
title = {Reducing the Vision and Language Bias for Temporal Sentence Grounding},
author = {Daizong Liu and Xiaoye Qu and Wei Hu},
journal= {arXiv preprint arXiv:2207.13457},
year = {2022}
}
备注
Accepted by ACM MM 2022