腾讯文本-视频检索:基于多级表示的层次化跨模态交互
计算机视觉与模式识别
2022-12-20 v8
摘要
文本-视频检索在多模态理解中扮演着重要角色,近年来吸引了越来越多的关注。现有方法大多侧重于构建完整视频与完整描述句子之间的对比对,而忽略了细粒度的跨模态关系,例如片段-短语或帧-词。在本文中,我们提出了一种名为层次化跨模态交互 (HCMI) 的新方法,用于探索文本-视频检索中视频-句子、片段-短语和帧-词之间的多级跨模态关系。考虑到内在的语义帧关系,HCMI 执行自注意力以探索帧级相关性,并自适应地将相关帧聚类为片段级和视频级表示。通过这种方式,HCMI 为帧-片段-视频粒度构建了多级视频表示以捕获细粒度视频内容,并为词-短语-句子粒度的文本模态构建了多级文本表示。借助视频和文本的多级表示,设计了层次化对比学习来探索细粒度的跨模态关系,即帧-词、片段-短语和视频-句子,这使得 HCMI 能够实现视频与文本模态之间全面的语义比较。在自适应标签去噪和边缘样本增强的进一步推动下,HCMI 在多个基准数据集上取得了新的最优结果,例如在 MSR-VTT、MSVD、LSMDC、DiDemo 和 ActivityNet 上的 Rank@1 分别达到 55.0%、58.2%、29.7%、52.1% 和 57.3%。
引用
@article{arxiv.2204.03382,
title = {Tencent Text-Video Retrieval: Hierarchical Cross-Modal Interactions with Multi-Level Representations},
author = {Jie Jiang and Shaobo Min and Weijie Kong and Dihong Gong and Hongfa Wang and Zhifeng Li and Wei Liu},
journal= {arXiv preprint arXiv:2204.03382},
year = {2022}
}