中文

Clover:迈向统一的视频-语言对齐与融合模型

计算机视觉与模式识别 2022-12-21 v3

摘要

构建一个用于解决各类视频理解任务(例如文本-视频检索、视频问答)的通用视频-语言模型是机器学习领域的一个开放挑战。为此,近期多数工作通过堆叠单模态与跨模态特征编码器并以成对对比预文本任务进行训练来构建模型。尽管具有诱人的通用性,所得模型不得不在效率与性能之间折衷,且大多采用不同架构处理不同下游任务。我们发现这是因为成对训练无法很好地对齐与融合来自不同模态的特征。我们进而提出 Clover——一种关联视频-语言预训练方法——旨在构建通用视频-语言模型,在不牺牲性能与效率的前提下解决多个视频理解任务。该方法通过一种新颖的三模态对齐预训练任务改进跨模态特征对齐与融合。此外,我们提出通过引入语义掩码样本的学习以及一种新的成对排序损失来增强三模态对齐。Clover 在多个下游任务上确立了新的 SOTA,包括零样本与微调设置下的三个检索任务,以及八个视频问答任务。代码与预训练模型将发布于 https://github.com/LeeYN-43/Clover。

关键词

引用

@article{arxiv.2207.07885,
  title  = {Clover: Towards A Unified Video-Language Alignment and Fusion Model},
  author = {Jingjia Huang and Yinan Li and Jiashi Feng and Xinglong Wu and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2207.07885},
  year   = {2022}
}

备注

Update Tri-modal Alignment task