SAM4MLLM: 增强多模态大语言模型以实现指称表达式分割
人工智能
2024-12-17 v3 计算与语言
计算机视觉与模式识别
摘要
我们引入了 SAM4MLLM,这是一种将 Segment Anything Model (SAM) 与多模态大语言模型 (MLLM) 相结合以用于像素感知任务的创新型方法。我们的方法使 MLLM 能够学习像素级位置信息,而无需对现有模型架构进行过多修改或添加专用 token。我们引入了一种基于查询的方法,该方法能够基于 MLLM 有效地为 SAM 寻找提示点以执行分割。它以统一的语言方式将详细的视觉信息与大语言模型强大的表达能力相结合,且在学习中不产生额外的计算开销。在公开基准上的实验结果证明了我们方法的有效性。
引用
@article{arxiv.2409.10542,
title = {SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation},
author = {Yi-Chia Chen and Wei-Hua Li and Cheng Sun and Yu-Chiang Frank Wang and Chu-Song Chen},
journal= {arXiv preprint arXiv:2409.10542},
year = {2024}
}
备注
ECCV 2024