语言并非全部所需:将感知与语言模型对齐
计算与语言
2023-03-02 v2 计算机视觉与模式识别
摘要
语言、多模态感知、行动与世界建模的大融合是迈向通用人工智能的关键一步。本工作中,我们介绍 Kosmos-1,一种多模态大语言模型(MLLM),能够感知通用模态、进行上下文学习(即少样本)并遵循指令(即零样本)。具体而言,我们从头开始在网页规模多模态语料库上训练 Kosmos-1,包括任意交错文本与图像、图文对以及文本数据。我们在广泛任务上评估了零样本、少样本和多模态思维链提示等多种设置,且未使用任何梯度更新或微调。实验结果表明,Kosmos-1 在以下方面取得令人印象深刻的性能:(i)语言理解、生成乃至无 OCR 的 NLP(直接输入文档图像);(ii)感知-语言任务,包括多模态对话、图像描述、视觉问答;以及(iii)视觉任务,如带描述的图像识别(通过文本指令指定分类)。我们还展示了 MLLM 可受益于跨模态迁移,即从语言到多模态、以及从多模态到语言的知识的迁移。此外,我们引入了一个 Raven 智商测试数据集,用于诊断 MLLM 的非语言推理能力。
引用
@article{arxiv.2302.14045,
title = {Language Is Not All You Need: Aligning Perception with Language Models},
author = {Shaohan Huang and Li Dong and Wenhui Wang and Yaru Hao and Saksham Singhal and Shuming Ma and Tengchao Lv and Lei Cui and Owais Khan Mohammed and Barun Patra and Qiang Liu and Kriti Aggarwal and Zewen Chi and Johan Bjorck and Vishrav Chaudhary and Subhojit Som and Xia Song and Furu Wei},
journal= {arXiv preprint arXiv:2302.14045},
year = {2023}
}