CAT:增强多模态大语言模型以回答动态视听场景中的问题
计算机视觉与模式识别
2024-03-08 v1
摘要
本文关注在由丰富且复杂的动态视听组件构成的场景中回答问题的挑战。尽管现有的多模态大语言模型(MLLM)能够对视听内容做出响应,但这些响应有时是模糊的,并且未能描述具体的视听事件。为了克服这一局限性,我们引入了 CAT,它从三个方面增强了 MLLM:1)除了直接桥接音频和视频之外,我们设计了一个线索聚合器,用于聚合动态视听场景中与问题相关的线索,以丰富大语言模型所需的详细知识。2)CAT 在混合多模态数据集上进行训练,允许在视听场景中直接应用。值得注意的是,我们收集了一个名为 AVinstruct 的视听联合指令数据集,以进一步增强 CAT 建模跨语义相关性的能力。3)我们提出了 AI 辅助的模糊感知直接偏好优化,这是一种专门用于重新训练模型以偏好非模糊响应并提高定位特定视听对象能力的策略。大量实验结果表明,CAT 在多模态任务上优于现有方法,尤其是在视听问答(AVQA)任务中。代码和收集的指令发布于 https://github.com/rikeilong/Bay-CAT。
引用
@article{arxiv.2403.04640,
title = {CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios},
author = {Qilang Ye and Zitong Yu and Rui Shao and Xinyu Xie and Philip Torr and Xiaochun Cao},
journal= {arXiv preprint arXiv:2403.04640},
year = {2024}
}