DeiSAM:基于指示性提示的分割一切模型
机器学习
2024-12-06 v2 人工智能
计算机视觉与模式识别
摘要
大规模预训练神经网络已在包括零样本图像分割在内的各种任务中展现出强大能力。为了在复杂场景中识别具体物体,人类本能地依赖自然语言中的指示性描述,即根据上下文指代某物,例如“桌上且在杯子后面的那个物体”。然而,由于缺乏在复杂场景中的推理能力,深度学习方法无法可靠地解释此类指示性表示。为解决这一问题,我们提出了 DeiSAM——一种将大型预训练神经网络与可微逻辑推理器相结合的方法,用于指示性提示分割。给定复杂的文本分割描述,DeiSAM 利用大型语言模型 (LLMs) 生成一阶逻辑规则,并在生成的场景图上执行可微前向推理。随后,DeiSAM 通过将物体与逻辑推断出的图像区域进行匹配来完成分割。作为评估的一部分,我们提出了 Deictic Visual Genome (DeiVG) 数据集,其中包含配对的视觉输入和复杂的指示性文本提示。我们的实证结果表明,对于指示性提示分割,DeiSAM 相较于纯数据驱动的基线方法有显著提升。
引用
@article{arxiv.2402.14123,
title = {DeiSAM: Segment Anything with Deictic Prompting},
author = {Hikaru Shindo and Manuel Brack and Gopika Sudhakaran and Devendra Singh Dhami and Patrick Schramowski and Kristian Kersting},
journal= {arXiv preprint arXiv:2402.14123},
year = {2024}
}
备注
Published as a conference paper at NeurIPS 2024