面向跨场景视频时序定位的样本重要性学习
计算机视觉与模式识别
2022-01-14 v1 信息检索
摘要
时序定位任务旨在根据给定的句子查询在未剪辑视频中定位视频片段。本文首次研究了专属于时序定位任务的一些表面偏差,并提出了一种新颖的针对性解决方案。最令人担忧的是,我们观察到现有的时序定位模型严重依赖视觉模态中的某些偏差(例如对频繁概念或特定时间间隔的高偏好)。这导致模型在跨场景测试设置中泛化性能较差。为此,我们提出一种称为去偏时序语言定位器(Debias-TLL)的新方法,以防止模型简单地记忆偏差,并强制其基于真实的跨模态关系来定位查询句子。Debias-TLL同时训练两个模型。根据我们的设计,这两个模型在判断一个样本时预测结果的较大差异揭示了该样本有较高概率为偏差样本。利用这一信息丰富的差异,我们设计了一种数据重加权方案来缓解数据偏差。我们在跨场景时序定位中评估所提出的模型,其中训练/测试数据来源异构。实验表明,与最先进的竞争对手相比,所提方法具有大幅度的优越性。
引用
@article{arxiv.2201.02848,
title = {Learning Sample Importance for Cross-Scenario Video Temporal Grounding},
author = {Peijun Bao and Yadong Mu},
journal= {arXiv preprint arXiv:2201.02848},
year = {2022}
}
备注
7 pages, 4 figures