中文

基于三元组部分边界对比学习与双模态注意力增强的文本-视频检索

计算机视觉与模式识别 2025-06-10 v3 人工智能 计算与语言 多媒体

摘要

近年来,网络视频的爆发使得文本-视频检索在视频过滤、推荐和搜索中愈发重要与普及。文本-视频检索旨在将相关文本/视频排在不相关项之前。该任务的核心在于精确度量文本与视频之间的跨模态相似度。近来,对比学习方法在文本-视频检索中展现出良好前景,其中多数聚焦于正负样本对的构建以学习文本与视频表示。然而,它们对困难负样本对关注不足,且缺乏建模不同层级语义相似度的能力。为解决这两个问题,本文使用两种新技术改进对比学习。首先,为利用困难样本获得鲁棒判别力,我们提出一种新颖的双模态注意力增强模块(DMAE),从文本与视觉线索中挖掘困难负样本对。通过进一步引入负样本感知 InfoNCE(NegNCE)损失,我们得以自适应识别所有这些困难负样本,并显式突出它们在训练损失中的影响。其次,本文认为三元组样本相比成对样本能更好地建模细粒度语义相似度。为此,我们提出一种新的三元组部分边界对比学习(TPM-CL)模块,通过为匹配的文本-视频对自动生成细粒度困难负样本来构建偏序三元组样本。所提出的 TPM-CL 设计了具有跨模态交互的自适应词元掩码策略以建模细微语义差异。大量实验表明,所提方法在四个广泛使用的文本-视频检索数据集(包括 MSR-VTT、MSVD、DiDeMo 和 ActivityNet)上优于现有方法。

关键词

引用

@article{arxiv.2309.11082,
  title  = {Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning},
  author = {Chen Jiang and Hong Liu and Xuzheng Yu and Qing Wang and Yuan Cheng and Jia Xu and Zhongyi Liu and Qingpei Guo and Wei Chu and Ming Yang and Yuan Qi},
  journal= {arXiv preprint arXiv:2309.11082},
  year   = {2025}
}

备注

Accepted by ACM MM 2023