Meerkat:面向空间与时间 grounding 的音视频大语言模型
计算机视觉与模式识别
2024-07-04 v2 人工智能
机器学习
音频与语音处理
摘要
借鉴大语言模型在文本任务中卓越的性能,近期的多模态大语言模型(MLLMs)将其扩展至视觉和音频等其他模态。然而,这些方向的进展大多聚焦于仅需粗粒度理解音视频语义的任务。我们提出的 Meerkat 是一种具备图像和音频在空间与时间上细粒度理解能力的音视频大语言模型。通过一种基于最优传输的新型模态对齐模块以及 enforces 音视频一致性的跨注意力模块,Meerkat 能够处理诸如音频指示图像 grounding、图像引导音频时间局部化和音视频事实核查等具有挑战性的任务。此外,我们精心策划了大型数据集 AVFIT,其中包含 300 万条来自开源数据集的指令调优样本,并引入 MeerkatBench 以统一这五项具有挑战性的音视频任务。我们在所有下游任务上实现了最新性能,相对提升最高可达 37.12%。
引用
@article{arxiv.2407.01851,
title = {Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time},
author = {Sanjoy Chowdhury and Sayan Nag and Subhrajyoti Dasgupta and Jun Chen and Mohamed Elhoseiny and Ruohan Gao and Dinesh Manocha},
journal= {arXiv preprint arXiv:2407.01851},
year = {2024}
}
备注
Accepted at ECCV 2024