NExT-Chat:一种用于对话、检测与分割的大多模态模型
计算机视觉与模式识别
2023-12-19 v4 人工智能
计算与语言
摘要
大语言模型(LLMs)的发展极大地推动了多模态理解领域,催生了大多模态模型(LMMs)。为了提升视觉理解水平,近期研究通过将目标边界框坐标表示为一系列文本序列(pix2seq)来赋予 LMMs 区域级理解能力。本文提出一种称为 pix2emb 方法的物体定位建模新范式,要求 LMM 输出位置嵌入,随后用不同解码器进行解码。该范式允许我们在多模态对话中使用不同的位置格式(如边界框和掩码)。利用所提出的 pix2emb 方法,我们训练了名为 NExT-Chat 的 LMM,并展示了其处理视觉定位、区域描述和基于定位的推理等多任务的能力。综合实验表明我们的 NExT-Chat 在各项任务上的有效性,例如在 POPE-Random 上 NExT-Chat(87.7)对比 Shikra(86.9),在指代表达分割任务上 NExT-Chat(68.9)对比 LISA(67.9),在区域描述任务上 NExT-Chat(79.6)对比 Kosmos-2(62.3)。代码与模型发布于 https://github.com/NExT-ChatV/NExT-Chat。
引用
@article{arxiv.2311.04498,
title = {NExT-Chat: An LMM for Chat, Detection and Segmentation},
author = {Ao Zhang and Yuan Yao and Wei Ji and Zhiyuan Liu and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2311.04498},
year = {2023}
}
备注
Technical Report (https://next-chatv.github.io/)