用于视频语料库中时刻定位的分层多模态编码器
计算机视觉与模式识别
2020-11-25 v2 计算与语言
摘要
在长视频中识别出与文本查询在语义上匹配的短视频段是一项具有挑战性的任务,在基于语言的视频搜索、浏览和导航中具有重要的应用潜力。典型的检索系统对查询的响应要么是整个视频,要么是预定义的视频片段,但在未剪辑和未分段的视频中定位未定义的片段极具挑战性,因为穷举搜索所有可能的片段是难以实现的。突出的挑战在于,视频的表示必须考虑时间域内不同层级的粒度。为了解决这个问题,我们提出了分层多模态编码器(HAMMER),它在粗粒度的片段级别和细粒度的帧级别对视频进行编码,以基于多个子任务(即视频检索、片段时间定位和掩码语言建模)在不同尺度上提取信息。我们进行了广泛的实验,以在 ActivityNet Captions 和 TVR 数据集上评估我们的模型在视频语料库时刻定位上的表现。我们的方法优于先前的方法以及强基线,为该任务确立了新的 SOTA。
引用
@article{arxiv.2011.09046,
title = {A Hierarchical Multi-Modal Encoder for Moment Localization in Video Corpus},
author = {Bowen Zhang and Hexiang Hu and Joonseok Lee and Ming Zhao and Sheide Chammas and Vihan Jain and Eugene Ie and Fei Sha},
journal= {arXiv preprint arXiv:2011.09046},
year = {2020}
}