中文

分层 MLANet:基于多级注意力机制的单图像 3D 人脸重建

计算机视觉与模式识别 2025-09-30 v3

摘要

由于具有广泛的潜在应用前景,从二维自然图像中恢复 3D 人脸模型在计算机视觉领域引起了广泛关注。然而,缺乏带有真实标签的数据集以及真实世界环境的复杂性仍然是重大挑战。在本章中,我们提出了一种基于卷积神经网络的方法——分层多级注意力网络(MLANet),用于从单张自然图像中重建 3D 人脸模型。我们的模型能够从单张图像中预测详细的人脸几何、纹理、姿态和光照参数。具体而言,我们采用预训练的分层骨干网络,并在二维人脸图像特征提取的不同阶段引入多级注意力机制。我们采用半监督训练策略,结合来自公开数据集的 3D 可形变模型(3DMM)参数以及可微渲染器,实现了端到端的训练过程。我们在 AFLW2000-3D 和 MICC Florence 两个基准数据集上进行了大量实验,包括对比实验和消融实验,重点关注 3D 人脸重建和 3D 人脸对齐任务。所提方法的有效性通过定量和定性两方面进行了评估。

关键词

引用

@article{arxiv.2509.10024,
  title  = {Hierarchical MLANet: Multi-level Attention for 3D Face Reconstruction From Single Images},
  author = {Danling Cao},
  journal= {arXiv preprint arXiv:2509.10024},
  year   = {2025}
}

备注

This work was completed during danling's MPhil studies at the University of Manchester