中文

VALOR:视觉-音频-语言全感知预训练模型与数据集

机器学习 2025-01-07 v2 计算与语言 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

本文提出一种用于多模态理解与生成的视觉-音频-语言全感知预训练模型(VALOR)。与广泛研究的视觉-语言预训练模型不同,VALOR以端到端方式联合建模视觉、音频与语言的关系。它包含三个独立的单模态表示编码器,以及一个用于多模态条件文本生成的解码器。我们设计了两个预训练任务来预训练VALOR模型,包括多模态分组对齐(MGA)和多模态分组描述(MGC)。MGA将视觉、语言和音频投影到同一公共空间,同时建立视觉-语言、音频-语言和视听-语言对齐。MGC学习在视觉、音频或二者条件下生成文本词元。为推动视觉-音频-语言预训练研究,我们构建了一个大规模高质量三模态数据集VALOR-1M,包含100万条带人工标注视听描述的可听视频。大量实验表明,VALOR能学习到强多模态关联,并可泛化至各类下游任务(如检索、描述与问答),支持不同输入模态(如视觉-语言、音频-语言和视听-语言)。VALOR在一系列公开跨模态基准上取得了新的SOTA性能。代码与数据见项目页 https://casia-iva-group.github.io/projects/VALOR。

关键词

引用

@article{arxiv.2304.08345,
  title  = {VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset},
  author = {Jing Liu and Sihan Chen and Xingjian He and Longteng Guo and Xinxin Zhu and Weining Wang and Jinhui Tang},
  journal= {arXiv preprint arXiv:2304.08345},
  year   = {2025}
}

备注

Preprint version w/o audio files embeded in PDF. Audio embeded version can be found on project page or github