逐项列举:多模态大语言模型的一种新数据来源与学习范式
计算机视觉与模式识别
2025-01-22 v2 人工智能
计算与语言
摘要
集合式标记(Set-of-Mark, SoM)提示通过在图像上插入可被文本标记索引的标签,释放了GPT-4V的视觉 grounding 能力。尽管GPT-4V表现卓越,但其他多模态大语言模型(MLLMs)难以理解这些视觉标签。为促进开源模型学习SoM提示,我们提出了一种新学习范式:"逐项列举",要求模型按标签的字母数字顺序枚举并描述图像上所有视觉标签。我们将精选数据集与其他视觉指令调优数据集集成,成功为现有MLLMs注入SoM提示能力。进一步评估我们微调的SoM模型在五个MLLMs基准测试中的表现,发现该数据集即使规模较小(10k-30k带标签图像),也显著提升了视觉推理能力并减少了幻觉。令人惊讶的是,这些改进在推理时即使省略视觉标签仍可持续。我们通过探测训练模型来理解SoM的工作机制。我们的代码和数据已公开于\url{https://github.com/zzxslp/SoM-LLaVA}。
引用
@article{arxiv.2404.16375,
title = {List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs},
author = {An Yan and Zhengyuan Yang and Junda Wu and Wanrong Zhu and Jianwei Yang and Linjie Li and Kevin Lin and Jianfeng Wang and Julian McAuley and Jianfeng Gao and Lijuan Wang},
journal= {arXiv preprint arXiv:2404.16375},
year = {2025}
}
备注
published at COLM-2024