中文

MAMA:用于视频-语言表示学习的元优化角度间隔对比框架

计算机视觉与模式识别 2024-10-11 v4 计算与语言

摘要

数据质量是决定视频-语言表示学习有效性的首要因素。然而,以往数据中的视频-文本对通常彼此并未完美对齐,这可能导致无法准确反映跨模态语义的视频-语言表示。此外,以往数据中的概念分布也不均匀,从而阻碍了在冷门主题上的下游性能。为了解决这些问题,我们提出了 MAMA,这是一种利用带有减法角度间隔的对比目标来正则化跨模态表示以使其达到完美相似度的新方法,用于学习视频-语言表示。此外,为了适应不均匀的概念分布,MAMA 利用由多层感知机 (MLP) 参数化的加权函数,将损失值映射为样本权重,从而能够在整个训练过程中动态调整模型的焦点。在少量无偏元数据的指导下进行训练,并由大型视觉-语言模型生成的视频-文本数据增强,MAMA 改进了视频-语言表示,并在常用的视频问答和文本-视频检索数据集上取得了卓越的性能。代码、模型和数据已在 https://nguyentthong.github.io/MAMA 上提供。

关键词

引用

@article{arxiv.2407.03788,
  title  = {MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning},
  author = {Thong Nguyen and Yi Bin and Xiaobao Wu and Xinshuai Dong and Zhiyuan Hu and Khoi Le and Cong-Duy Nguyen and See-Kiong Ng and Luu Anh Tuan},
  journal= {arXiv preprint arXiv:2407.03788},
  year   = {2024}
}

备注

Accepted to ECCV 2024