中文

超越广角图像:结构到细节的视频肖像纠正——基于无监督时空适应

计算机视觉与模式识别 2025-08-07 v2 人工智能

摘要

广角镜头尽管流行于内容创作,却因引起人脸拉伸的畸变——尤其在镜头边缘——损害视觉效果。为此,我们提出了名为ImagePC的结构到细节肖像纠正模型。它融合了变压器的长程感知和扩散模型的多步去噪能力,实现了全局结构鲁棒性和局部细节细化。此外,考虑到获取视频标签的高成本,我们将ImagePC用于无标记宽角视频(称为VideoPC),通过时空扩散适应并施加空间一致性和时间平滑约束。在前者中,我们鼓励去噪后的图像近似遵循宽角畸变分布模式的伪标签;在后者中,我们推导纠正轨迹并使用反向光流进行平滑处理。与ImagePC相比,VideoPC在空间上保持高质量的人脸纠正,同时在盲目场景下缓解了连续性时序抖动。最后,为建立评估基准并训练框架,我们建立了一个包含大量人数、光照条件和背景多样性的视频肖像数据集。实验表明,所提方法在定量和定性方面均优于现有解决方案,为具有稳定自然肖像的高保真宽角视频贡献了力量。代码和数据集将公开提供。

关键词

引用

@article{arxiv.2504.00401,
  title  = {Beyond Wide-Angle Images: Structure-to-Detail Video Portrait Correction via Unsupervised Spatiotemporal Adaptation},
  author = {Wenbo Nie and Lang Nie and Chunyu Lin and Jingwen Chen and Ke Xing and Jiyuan Wang and Kang Liao},
  journal= {arXiv preprint arXiv:2504.00401},
  year   = {2025}
}