中文

揭示不可见之物:以AURA进行复杂遮挡的非模态推理

计算机视觉与模式识别 2025-07-16 v2

摘要

非模态分割旨在推断被遮挡物体的完整形状,即使被遮挡区域的外观不可用。然而,当前的非模态分割方法缺乏通过文本输入与用户交互的能力,并且难以理解或推理隐含和复杂的目的。虽然像LISA这样的方法将多模态大语言模型(LLMs)与分割相结合用于推理任务,但它们仅限于预测可见物体区域,并且在处理复杂遮挡场景时面临挑战。为了解决这些局限性,我们提出了一项名为非模态推理分割的新任务,旨在预测被遮挡物体的完整非模态形状,同时基于用户文本输入提供带有详述的答案。我们开发了一个可泛化的数据集生成流水线,并引入了一个聚焦于日常生活场景的新数据集,涵盖多样化的真实世界遮挡。此外,我们提出了AURA(非模态理解与推理助手),一个具有先进全局和空间级设计的新型模型,专门用于处理复杂遮挡。大量实验验证了AURA在所提出数据集上的有效性。

关键词

引用

@article{arxiv.2503.10225,
  title  = {Unveiling the Invisible: Reasoning Complex Occlusions Amodally with AURA},
  author = {Zhixuan Li and Hyunse Yoon and Sanghoon Lee and Weisi Lin},
  journal= {arXiv preprint arXiv:2503.10225},
  year   = {2025}
}

备注

Accepted by ICCV 2025, 17 pages, 9 figures, 5 tables