IRISformer:用于室内场景单图像逆渲染的密集视觉 Transformer
计算机视觉与模式识别
2022-06-20 v1
摘要
室内场景由于任意多样物体形状、空间变化材质与复杂光照之间无数相互作用而表现出显著的外观变化。由可见与不可见光源引起的阴影、高光与相互反射需要对长程相互作用进行推理以实现逆渲染,其旨在恢复图像形成的组成部分,即形状、材质与光照。在本工作中,我们的直觉是 transformer 架构学习的长程注意力非常适合于解决单图像逆渲染中长期存在的挑战。我们通过一个密集视觉 transformer 的具体实例 IRISformer 证明,其在逆渲染所需的单任务与多任务推理上均表现出色。具体而言,我们提出一种 transformer 架构,用于从单张室内场景图像同时估计深度、法线、空间变化反照率、粗糙度与光照。我们在基准数据集上的广泛评估表明在上述各项任务上均取得了 state-of-the-art 结果,实现了在单张无约束真实图像中进行物体插入与材质编辑等应用,且比先前工作具有更高的真实感。代码与数据已公开发布于 https://github.com/ViLab-UCSD/IRISformer。
引用
@article{arxiv.2206.08423,
title = {IRISformer: Dense Vision Transformers for Single-Image Inverse Rendering in Indoor Scenes},
author = {Rui Zhu and Zhengqin Li and Janarbek Matai and Fatih Porikli and Manmohan Chandraker},
journal= {arXiv preprint arXiv:2206.08423},
year = {2022}
}
备注
CVPR 22 camera ready version with supplementary