LAMM:语言辅助多模态指令微调数据集、框架与基准
计算机视觉与模式识别
2023-11-07 v3
摘要
大语言模型已成为实现通用AI智能体的一种有前景的方法。蓬勃发展的开源LLM社区极大加速了通过自然语言处理支持人机对话交互的智能体开发。然而,人类与世界的互动超越仅以文本作为模态,视觉等其他模态也至关重要。近期多模态大语言模型(如GPT-4V和Bard)的工作已展示其在处理视觉模态上的有效性。然而,这些工作的透明度有限,不足以支撑学术研究。据我们所知,我们提出了该领域最早的开源尝试之一LAMM,涵盖语言辅助多模态(Language-Assisted Multi-Modal)指令微调数据集、框架与基准。我们的目标是将LAMM建立为用于训练和评估MLLM的成长型生态系统,特别关注促成能够弥合想法与执行之间差距、从而实现无缝人机交互的AI智能体。我们的主要贡献有三:1)我们提出覆盖2D与3D视觉广泛视觉任务的综合数据集与基准,大量实验验证了数据集与基准的有效性。2)我们梳理了为MLLM构建多模态指令微调数据集与基准的详细方法,支持将MLLM研究快速扩展至不同领域、任务与模态。3)我们提供了一个初级但具潜力的、为模态扩展优化的MLLM训练框架。我们还提供基线模型、综合实验观察与分析以加速未来研究。我们的基线模型在24个A100 GPU小时内完成训练,得益于开源社区,框架支持使用V100与RTX3090训练。
引用
@article{arxiv.2306.06687,
title = {LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark},
author = {Zhenfei Yin and Jiong Wang and Jianjian Cao and Zhelun Shi and Dingning Liu and Mukai Li and Lu Sheng and Lei Bai and Xiaoshui Huang and Zhiyong Wang and Jing Shao and Wanli Ouyang},
journal= {arXiv preprint arXiv:2306.06687},
year = {2023}
}
备注
NeurIPS2023 camera ready ; 37 pages, 33 figures. Code available at https://github.com/OpenLAMM/LAMM ; Project page: https://openlamm.github.io/