用于弱监督时刻检索的多尺度二维表示学习
计算机视觉与模式识别
2021-11-05 v1 机器学习
摘要
视频时刻检索旨在搜索与给定语言查询最相关的时刻。然而,该领域大多数现有方法通常需要时间边界标注,这既昂贵又耗时。因此,近期提出了仅使用粗略视频级标签的弱监督方法。尽管有效,这些方法通常独立地处理时刻候选,而忽略了不同时间尺度的候选之间存在自然时间依赖性这一关键问题。为解决此问题,我们提出了一种用于弱监督视频时刻检索的多尺度二维表示学习方法。具体而言,我们首先为每个时间尺度构建一个二维图,以捕捉候选之间的时间依赖性。该图的两个维度表示这些候选的起始和结束时间点。然后,我们使用可学习的卷积神经网络从每个尺度变化的图中选择前 K 个候选。通过新设计的时刻评估模块,我们获得了所选候选的对齐分数。最后,字幕与语言查询之间的相似度被用作进一步训练候选选择器的监督信号。在两个基准数据集 Charades-STA 和 ActivityNet Captions 上的实验表明,我们的方法取得了优于 SOTA 结果的性能。
引用
@article{arxiv.2111.02741,
title = {Multi-scale 2D Representation Learning for weakly-supervised moment retrieval},
author = {Ding Li and Rui Wu and Yongqiang Tang and Zhizhong Zhang and Wensheng Zhang},
journal= {arXiv preprint arXiv:2111.02741},
year = {2021}
}
备注
8 pages, 4 figuers. Accepted for publication in 2020 25th International Conference on Pattern Recognition (ICPR)