整合多模态大语言模型知识用于无遮挡完成
计算机视觉与模式识别
2026-03-31 v1 人工智能
摘要
随着自动驾驶和机器人技术的广泛采用,无遮挡完成(amodal completion)——即重建图像中被遮挡的人和物体的缺失部分——变得日益重要。正如人类会基于先前经验和常识推断隐藏区域一样,该任务本质上需要关于真实世界实体的物理知识。然而,现有方法要么仅依赖视觉生成模型的图像生成能力,而缺乏此类知识;要么仅在分割阶段利用它,无法在完成过程中显式地引导。为此,我们提出AmodalCG框架,利用多模态大语言模型(MLLM)的真实世界知识来指导无遮挡完成。该框架首先评估遮挡程度,以选择性地仅在目标物体遮挡严重时调用MLLM指导。若需要指导,框架进一步利用MLLM推理关于(1)遮挡程度和(2)缺失区域内容。最后,视觉生成模型整合这些指导并迭代细化可能因MLLM指导不准确而产生的不完美完成。在 various real-world images上的实验结果表明,与现有所有工作相比,效果显著提升,表明MLLM是解决具有挑战性的无遮挡完成问题的有前景的方向。
引用
@article{arxiv.2603.28333,
title = {Integrating Multimodal Large Language Model Knowledge into Amodal Completion},
author = {Heecheol Yun and Eunho Yang},
journal= {arXiv preprint arXiv:2603.28333},
year = {2026}
}