中文

COSA:基于拼接样本预训练的视觉-语言基础模型

计算机视觉与模式识别 2023-06-16 v1 人工智能 计算与语言 机器学习 多媒体

摘要

由于视频-文本训练语料的规模和质量有限,大多数视觉-语言基础模型采用图像-文本数据集进行预训练,并主要关注视觉语义表示的建模,而忽略了时间语义表示及其关联。为解决此问题,我们提出了 COSA,一种基于拼接样本预训练的视觉-语言基础模型(COncatenated SAmple pretrained vision-language foundation model)。COSA 仅使用图像-文本语料联合建模视觉内容与事件级时间线索。我们通过将多个图像-文本对按顺序拼接作为预训练输入来实现这一点。这种转换有效地将现有图像-文本语料转化为伪长视频-段落语料,从而实现更丰富的场景转换与显式的事件-描述对应。大量实验表明,COSA 在广泛的下游任务上持续提升性能,包括长视频/短视频-文本任务以及检索、描述生成和问答等图像-文本任务。值得注意的是,COSA 在多个具有竞争力的基准上取得了最先进(state-of-the-art)结果。代码与模型发布于 https://github.com/TXH-mercury/COSA。

关键词

引用

@article{arxiv.2306.09085,
  title  = {COSA: Concatenated Sample Pretrained Vision-Language Foundation Model},
  author = {Sihan Chen and Xingjian He and Handong Li and Xiaojie Jin and Jiashi Feng and Jing Liu},
  journal= {arXiv preprint arXiv:2306.09085},
  year   = {2023}
}