CaMML:面向大模型的上下文感知多模态学习器
计算机视觉与模式识别
2024-06-21 v3
摘要
在这项工作中,我们引入了上下文感知多模态学习器(CaMML),用于微调大型多模态模型(LMM)。CaMML是一个轻量级模块,旨在将多模态上下文样本无缝集成到大模型中,从而使模型能够从类似的、特定领域的、最新的信息中获取知识,并做出有依据的推理。重要的是,CaMML具有高度可扩展性,并且由于其分层设计,能够高效处理冗长的多模态上下文示例。基于CaMML,我们开发了两个多模态模型CaMML-7B和CaMML-13B,它们在多模态任务的一系列基准数据集上表现出了卓越的性能。值得注意的是,CaMML-13B在超过十个广泛认可的多模态基准数据集上达到了最先进的性能,以明显优势超越了LLaVA-1.5(13B),且未集成任何外部资源。此外,我们进行了广泛的消融研究以考察CaMML的内部工作机制,并进行了定性分析以展示其在处理现实世界挑战性案例中的有效性。代码和模型可在以下链接获取:https://github.com/amazon-science/camml。
引用
@article{arxiv.2401.03149,
title = {CaMML: Context-Aware Multimodal Learner for Large Models},
author = {Yixin Chen and Shuai Zhang and Boran Han and Tong He and Bo Li},
journal= {arXiv preprint arXiv:2401.03149},
year = {2024}
}
备注
Preprint