Shikra:释放多模态大语言模型的指代表达对话魔力
计算机视觉与模式识别
2023-07-04 v2
摘要
在人类对话中,个体可在言及他人时指示场景中的相关区域。作为回应,另一方亦可在必要时通过指代特定区域来答复。这种对话中自然的指代能力在当前多模态大语言模型(MLLM)中仍缺失。为填补此空白,本文提出一种称为 Shikra 的 MLLM,其可处理自然语言中的空间坐标输入与输出。其架构由视觉编码器、对齐层与大语言模型组成。设计上直接而简洁,无需额外词表、位置编码器、检测前/后模块或外部插件模型。所有输入与输出均为自然语言形式。指代表达对话是多种视觉-语言(VL)任务的超集。Shikra 可自然处理 REC 与 PointQA 等位置相关任务,以及图像描述与 VQA 等常规 VL 任务。实验结果展现了 Shikra 的良好性能。此外,其支持众多令人兴奋的应用,如以思维链给出提及对象的坐标、比较用户指向区域的相似度。我们的代码、模型与数据集见于 https://github.com/shikras/shikra。
引用
@article{arxiv.2306.15195,
title = {Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic},
author = {Keqin Chen and Zhao Zhang and Weili Zeng and Richong Zhang and Feng Zhu and Rui Zhao},
journal= {arXiv preprint arXiv:2306.15195},
year = {2023}
}