中文

LLaVA-Plus:学习使用工具以构建多模态智能体

计算机视觉与模式识别 2023-11-10 v1 人工智能 计算与语言 机器学习 多媒体

摘要

LLaVA-Plus 是一个通用多模态助手,扩展了大型多模态模型的能力。它维护一个由预训练视觉与视觉-语言模型组成的技能库,并能够根据用户输入激活相关工具以完成真实世界任务。LLaVA-Plus 在多模态指令跟随数据上训练,以习得使用工具的能力,涵盖视觉理解、生成、外部知识检索与组合。实证结果表明,LLaVA-Plus 在已有能力上优于 LLaVA,并展现出新的能力。其独特之处在于,图像查询在整个以人为中心的人-AI 交互过程中被直接定位并主动参与,显著提升了工具使用性能并实现了新场景。

关键词

引用

@article{arxiv.2311.05437,
  title  = {LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents},
  author = {Shilong Liu and Hao Cheng and Haotian Liu and Hao Zhang and Feng Li and Tianhe Ren and Xueyan Zou and Jianwei Yang and Hang Su and Jun Zhu and Lei Zhang and Jianfeng Gao and Chunyuan Li},
  journal= {arXiv preprint arXiv:2311.05437},
  year   = {2023}
}

备注

25 pages, 25M file size. Project Page: https://llava-vl.github.io/llava-plus/