基于对比学习的时间上下文聚合视频检索
计算机视觉与模式识别
2020-10-01 v2 机器学习
多媒体
摘要
当前基于内容的视频检索研究焦点需要更高层次的视频表示,以描述相关事件、片段等的长程语义依赖。然而,现有方法通常将视频帧作为独立图像或短片段处理,致使长程语义依赖建模困难。本文中,我们提出 TCA(用于视频检索的时间上下文聚合),一种视频表示学习框架,利用自注意力机制融合帧级特征间的长程时间信息。为在视频检索数据集上训练它,我们提出一种监督对比学习方法,执行自动难负样本挖掘并利用记忆库机制以增加负样本容量。我们在多个视频检索任务(如 CC_WEB_VIDEO、FIVR-200K 与 EVVE)上进行了充分实验。所提方法相较具备视频级特征的当前最优(SOTA)方法展现出显著性能优势(FIVR-200K 上约 17% mAP),且相比帧级特征推理时间快 22 倍,取得了具竞争力的结果。
引用
@article{arxiv.2008.01334,
title = {Temporal Context Aggregation for Video Retrieval with Contrastive Learning},
author = {Jie Shao and Xin Wen and Bingchen Zhao and Xiangyang Xue},
journal= {arXiv preprint arXiv:2008.01334},
year = {2020}
}