中文

IDT:用于前馈多视图内蕴分解的物理驱动 Transformer

计算机视觉与模式识别 2026-01-01 v2

摘要

内蕴图像分解是视觉理解的基础,因为 RGB 图像纠缠了材质属性、光照和视图相关效应。近期基于扩散的方法在单视图内蕴分解中取得了优异结果;然而,将这些方法扩展到多视图设置仍具挑战性,常导致严重的视图不一致。我们提出了 \textbf{Intrinsic Decomposition Transformer (IDT)},一个用于多视图内蕴图像分解的前馈框架。通过利用基于 Transformer 的注意力机制对多幅输入图像进行联合推理,IDT 在单次前向传播中产生视图一致的内蕴因子,无需迭代生成采样。IDT 采用物理驱动的图像成像模型,将图像显式分解为漫反射率、漫反射着色和镜面反射着色。这种结构化分解分离了 Lambertian 和非 Lambertian 光传输,实现了跨视图的材质与光照效应的可解释且可控的分解。在合成和真实世界数据集上的实验表明,与先前的内蕴分解方法相比,IDT 获得了更干净的漫反射率、更连贯的漫反射着色以及更好分离的镜面反射分量,同时大幅提升了多视图一致性。

关键词

引用

@article{arxiv.2512.23667,
  title  = {IDT: A Physically Grounded Transformer for Feed-Forward Multi-View Intrinsic Decomposition},
  author = {Kang Du and Yirui Guan and Zeyu Wang},
  journal= {arXiv preprint arXiv:2512.23667},
  year   = {2026}
}

备注

10 pages 4 figures