SEA:用于文本查询视频检索的句子编码器集成
计算机视觉与模式识别
2020-11-25 v1 人工智能
机器学习
多媒体
摘要
通过文本查询检索未标注视频,即特设视频检索(AVS),是多媒体数据管理与检索的核心主题。AVS 的成功依赖于跨模态表征学习,其将查询句子与视频编码至公共空间以计算语义相似度。受先前少数结合多个句子编码器工作的初步成功启发,本文向前推进一步,开发一种有效利用多样化句子编码器的新的通用方法。所提方法的新颖性——我们称之为句子编码器集成(SEA)——有两方面。首先,不同于先前仅使用单一公共空间的方法,SEA 支持在多个编码器特定的公共空间中进行文本-视频匹配。该性质防止匹配被产生远长于其他编码器编码向量的特定编码器所主导。其次,为探索各公共空间间的互补性,我们提出多空间多损失学习。如在四个基准(MSR-VTT、TRECVID AVS 2016-2019、TGIF 与 MSVD)上的大量实验所示,SEA 超越了当前最优(SOTA)。此外,SEA 极易于实现。这一切使 SEA 成为 AVS 的引人注目解决方案,并有望通过利用新句子编码器持续推进该任务。
引用
@article{arxiv.2011.12091,
title = {SEA: Sentence Encoder Assembly for Video Retrieval by Textual Queries},
author = {Xirong Li and Fangming Zhou and Chaoxi Xu and Jiaqi Ji and Gang Yang},
journal= {arXiv preprint arXiv:2011.12091},
year = {2020}
}
备注
accepted for publication as a REGULAR paper in the IEEE Transactions on Multimedia