中文

CoAVT:一种面向多模态处理的认知启发式统一音频-视觉-文本预训练模型

音频与语音处理 2024-02-22 v2 多媒体 声音 图像与视频处理

摘要

长期以来,人们一直追求一个统一的音频-视觉-文本模型,以实现各种多模态理解任务,这模仿了人类的听、看和读的过程。人类倾向于使用两个独立的系统来表示知识:一个用于表示言语(文本)信息,另一个用于表示非言语(视觉和听觉)信息。这两个系统可以独立运作,但也可以相互交互。受这种对人类认知理解的启发,本文引入了 CoAVT——一种新颖的认知启发式关联音频-视觉-文本预训练模型,以连接这三种模态。它包含一个联合音频-视觉编码器,用于学习编码音频-视觉同步信息以及非言语信息的音频和视觉内容,以及一个文本编码器,用于处理言语信息的文本输入。为了弥合模态间的差距,CoAVT 使用了一个查询编码器,该编码器包含一组可学习的查询嵌入,并提取对应文本中最具信息量的视听特征。此外,为了分别利用音频与语言、视觉与语言之间的对应关系,我们还在基础的视听-文本三模态对齐之上建立了音频-文本和视觉-文本的双模态对齐,以增强多模态表示学习。最后,我们使用三个多模态目标联合优化 CoAVT 模型:对比损失、匹配损失和语言建模损失。大量实验表明,CoAVT 可以学习到强大的多模态相关性,并能泛化到各种下游任务。在 AudioCaps 上的文本-视频检索任务(零样本和微调设置)、AudioSet 和 VGGSound 上的音频-视觉事件分类和音频-视觉检索任务中,CoAVT 均建立了新的最先进性能。

关键词

引用

@article{arxiv.2401.12264,
  title  = {CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing},
  author = {Xianghu Yue and Xiaohai Tian and Lu Lu and Malu Zhang and Zhizheng Wu and Haizhou Li},
  journal= {arXiv preprint arXiv:2401.12264},
  year   = {2024}
}