中文

基于支持集的多模态表示增强用于视频描述生成

计算机视觉与模式识别 2022-05-20 v1

摘要

视频描述生成是一项具有挑战性的任务,需要对视觉场景有透彻的理解。现有方法遵循典型的一对一映射,集中于有限的样本空间而忽略样本间的内在语义关联,导致表达生硬且缺乏信息量。为解决此问题,我们提出一种新颖且灵活的框架,即基于支持集的多模态表示增强(SMRE)模型,以在样本间共享的语义子空间中挖掘丰富信息。具体而言,我们提出支持集构建(SC)模块来构造支持集,以学习样本间的潜在联系并获取语义相关的视觉元素。在此过程中,我们设计语义空间变换(SST)模块以约束相对距离并以自监督方式管理多模态交互。在 MSVD 和 MSR-VTT 数据集上的大量实验表明,我们的 SMRE 取得了最先进的性能。

关键词

引用

@article{arxiv.2205.09307,
  title  = {Support-set based Multi-modal Representation Enhancement for Video Captioning},
  author = {Xiaoya Chen and Jingkuan Song and Pengpeng Zeng and Lianli Gao and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2205.09307},
  year   = {2022}
}