指令引导的视觉掩码
计算机视觉与模式识别
2024-10-17 v2 人工智能
机器学习
机器人学
摘要
指令跟随在当代大语言模型中至关重要。然而,当扩展到多模态设置时,它常常遭受特定文本指令与图像目标局部区域之间的对齐问题。为了实现更准确和精细的多模态指令跟随,我们引入了指令引导的视觉掩码(IVM),这是一种新的通用视觉定位模型,可与多种多模态模型(如LMM和机器人模型)兼容。通过为指令无关区域构建视觉掩码,IVM增强的多模态模型可以有效聚焦于任务相关的图像区域,以更好地对齐复杂指令。具体来说,我们设计了一个视觉掩码数据生成流水线,并创建了包含100万图像-指令对的IVM-Mix-1M数据集。我们进一步引入了一种新的学习技术——判别器加权监督学习(DWSL),用于优先训练高质量数据样本的IVM。在通用多模态任务(如VQA和具身机器人控制)上的实验结果表明,IVM作为一种即插即用工具,显著提升了多种多模态模型的性能,在具有挑战性的多模态基准测试中取得了新的最先进结果。代码、模型和数据可在 https://github.com/2toinf/IVM 获取。
引用
@article{arxiv.2405.19783,
title = {Instruction-Guided Visual Masking},
author = {Jinliang Zheng and Jianxiong Li and Sijie Cheng and Yinan Zheng and Jiaming Li and Jihao Liu and Yu Liu and Jingjing Liu and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2405.19783},
year = {2024}
}
备注
NeurIPS 2024