中文

利用幻觉减少提示器对手动提示的依赖:面向可提示分割

计算机视觉与模式识别 2026-03-10 v4

摘要

可提示分割通常需要针对每个所需对象的实例性手动提示来指导分割。为最小化此种需求,已引入任务通用可提示分割,该方法使用单个任务通用提示来分割不同对象在同一任务中的不同图像。当前方法使用多模态大语言模型(MLLM)从任务通用提示中推理详细的实例性提示以提高分割精度。这种分割的有效性高度依赖于这些派生提示的精确度。然而,MLLM在推理过程中常常出现幻觉,导致提示不准确。虽然现有方法专注于消除幻觉以提高模型性能,但我们认为,正确利用幻觉可以揭示有价值的上下文信息,因为它们代表了超出单个图像的预训练大规模知识。本文利用幻觉从图像中矿采任务相关信息并验证其准确性以提高生成提示的精度。具体而言,我们引入一种迭代提示-掩码循环生成框架(ProMaC),包含提示生成器和掩码生成器。提示生成器采用多尺度链式思考式提示,最初通过探索测试图像中的幻觉来提取扩展的上下文知识。这些幻觉随后被简化以制定精确的实例性提示,指导掩码生成器产生与任务语义一致的掩码。生成的掩码迭代地诱导提示生成器更专注于任务相关的图像区域并减少无关幻觉,从而在提示和掩码方面取得双重改进。实验在5个基准数据集上表明,ProMaC的有效性。代码已提供:https://lwpyh.github.io/ProMaC/。

关键词

引用

@article{arxiv.2408.15205,
  title  = {Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation},
  author = {Jian Hu and Jiayi Lin and Junchi Yan and Shaogang Gong},
  journal= {arXiv preprint arXiv:2408.15205},
  year   = {2026}
}

备注

NeurIPS 2024