中文

面向面部图像的多尺度注意力引导内禀分解与渲染通道预测

计算机视觉与模式识别 2025-12-19 v1 图形学

摘要

在无约束光照条件下对面部图像进行准确的内禀分解,是实现照片级重光照、高保真数字孪生和增强现实效果的前提。本文提出 MAGINet,一种多尺度注意力引导内禀网络,可从单张 RGB 人像预测 512×512512\times512 光照归一化的漫反射反照率图。MAGINet 采用分层残差编码、瓶颈处的空间与通道注意力以及解码器中的自适应多尺度特征融合,相比先前的 U-Net 变体获得了更锐利的反照率边界和更强的光照不变性。初始反照率预测被上采样至 1024×10241024\times1024,并由一个轻量三层 CNN(RefinementNet)进行精细化。在该精细化反照率的条件下,基于 Pix2PixHD 的转换器进一步预测一组全面的五个基于物理的渲染通道:环境光遮蔽、表面法线、镜面反射率、半透明性和原始漫反射颜色(含残余光照)。连同精细化反照率,这六个通道构成完整的内禀分解。在 FFHQ-UV-Intrinsics 数据集上结合掩码 MSE、VGG、边缘和 patch-LPIPS 损失进行训练,全流程在漫反射反照率估计上达到最先进的性能,并在完整渲染栈上相比先前方法展现出显著提升的保真度。所得通道可实现真实面部的高质量重光照与材质编辑。

关键词

引用

@article{arxiv.2512.16511,
  title  = {Multi-scale Attention-Guided Intrinsic Decomposition and Rendering Pass Prediction for Facial Images},
  author = {Hossein Javidnia},
  journal= {arXiv preprint arXiv:2512.16511},
  year   = {2025}
}