中文

推理驱动的非模态补全:协作智能体与感知评估

计算机视觉与模式识别 2025-12-25 v1

摘要

非模态补全,即推断物体不可见部分的任务,在保持语义一致性和结构完整性方面面临重大挑战。先前的渐进式方法固有地受到推理不稳定性和误差累积的限制。为了解决这些局限性,我们提出了一个协作式多智能体推理框架,该框架明确地将语义规划与视觉合成解耦。通过采用专门的智能体进行前期推理,我们的方法在像素生成之前生成一个结构化的、明确的规划,从而实现视觉和语义上连贯的单次合成。我们将此框架与两个关键机制相结合:(1)一个自我校正的验证智能体,它采用思维链推理来纠正可见区域分割并识别残留的遮挡物,严格在语义规划阶段内完成;(2)一个多样化假设生成器,通过提供多样化、合理的语义解释来解决不可见区域的歧义性,超越了标准随机种子采样的有限像素级变化。此外,针对传统指标在评估推断出的不可见内容方面的局限性,我们引入了MAC-Score(MLLM非模态补全分数),这是一种新颖的、与人类判断对齐的评估指标。经过人类判断和真实值的验证,这些指标为评估结构完整性和与可见上下文的语义一致性建立了一个稳健的标准。大量实验表明,我们的框架在多个数据集上显著优于最先进的方法。我们的项目可在以下网址获取:https://fanhongxing.github.io/remac-page。

关键词

引用

@article{arxiv.2512.20936,
  title  = {Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation},
  author = {Hongxing Fan and Shuyu Zhao and Jiayang Ao and Lu Sheng},
  journal= {arXiv preprint arXiv:2512.20936},
  year   = {2025}
}