由粗到精:先视频检索后时刻定位
计算机视觉与模式识别
2021-10-15 v1
摘要
当前视频语料库时刻检索(VCMR)的最优方法常出于便利与速度的考虑而采用基于相似度的特征对齐方法。然而,余弦相似度对齐等后期融合方法无法充分利用查询文本与视频两方面的信息。本文中,我们将特征对齐与特征融合相结合,以提升 VCMR 的性能。
引用
@article{arxiv.2110.07201,
title = {Coarse to Fine: Video Retrieval before Moment Localization},
author = {Zijian Gao and Huanyu Liu and Jingyu Liu},
journal= {arXiv preprint arXiv:2110.07201},
year = {2021}
}