中文

基于解耦概念化与集合到集合对齐的文本-视频检索

计算机视觉与模式识别 2023-05-23 v1 人工智能 信息检索

摘要

文本-视频检索是一项具有挑战性的跨模态任务,旨在将视觉实体与自然语言描述对齐。现有方法要么无法利用局部细节,要么计算代价高昂。更糟糕的是,它们未能利用数据中的异构概念。本文提出解耦概念化与集合到集合对齐(DiCoSA)以模拟人类的概念化与推理过程。对于解耦概念化,我们将粗粒度特征划分为多个与语义概念相关的潜在因子。对于集合到集合对齐,即一组视觉概念对应一组文本概念,我们提出一种自适应池化方法聚合语义概念以解决局部匹配问题。特别地,由于仅在少数维度上独立编码概念,DiCoSA 在效率和粒度上更优,在以与粗粒度对齐相似的计算复杂度下确保细粒度交互。在 MSR-VTT、LSMDC、MSVD、ActivityNet 和 DiDeMo 五个数据集上的大量实验表明,我们的方法优于现有最先进方法。

关键词

引用

@article{arxiv.2305.12218,
  title  = {Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment},
  author = {Peng Jin and Hao Li and Zesen Cheng and Jinfa Huang and Zhennan Wang and Li Yuan and Chang Liu and Jie Chen},
  journal= {arXiv preprint arXiv:2305.12218},
  year   = {2023}
}

备注

IJCAI 2023