中文

ReasonX:由 MLLM 引导的内在图像分解

计算机视觉与模式识别 2025-12-05 v1

摘要

内在图像分解旨在将图像分离为物理组件,如镜面率、深度、法线和光照。尽管最近的扩散和变换器模型受益于来自合成数据集的配对监督,但其在针对多样化、真实场景的泛化能力仍具有挑战性。我们提出了ReasonX,一种新框架,利用多模态大语言模型(MLLM)作为感知评判家提供相对内在比较,并将这些比较作为 GRPO 奖励,用于在无标记、野外图像上对内在分解模型进行微调。不同于生成模型的 RL 方法,我们框架通过奖励评判家的关系性评估与模型输出的分析推导关系之间的一致性来实现条件内在预测器的对齐。ReasonX 是模型无关的,可应用于不同的内在预测器。我们在多个基线架构和模态上进行评估,ReasonX 实现了显著的改进,包括在 IIW 镜面率任务上达到9%-25%的 WHDR 降低,以及在 ETH3D 上实现最高46%的深度准确性提升,凸显了 MLLM 指导的比较监督在桥接低层和高层视觉推理方面的潜力。

关键词

引用

@article{arxiv.2512.04222,
  title  = {ReasonX: MLLM-Guided Intrinsic Image Decomposition},
  author = {Alara Dirik and Tuanfeng Wang and Duygu Ceylan and Stefanos Zafeiriou and Anna Frühstück},
  journal= {arXiv preprint arXiv:2512.04222},
  year   = {2025}
}