中文

FacEnhance:基于递归 DDPM 的面部表情增强

计算机视觉与模式识别 2024-06-14 v1

摘要

面部表情在非语言人类交流中至关重要,已在诸多计算机视觉领域找到应用,如虚拟现实、游戏和情感 AI 助手。尽管已取得进展,但许多面部表情生成模型面临挑战,如低分辨率(例如 32x32 或 64x64 像素)、质量不佳以及缺乏背景细节。本文介绍了 FacEnhance,一种新型扩散方法,旨在解决现有低分辨率面部表情生成模型的限制。FacEnhance 将低分辨率面部表情视频(64x64 像素)增强到更高分辨率(192x192 像素),并纳入背景细节,提高整体质量。利用条件去噪扩散框架,由无背景的低分辨率视频和单张中性表情高分辨率图像引导,FacEnhance 生成包含来自低分辨率视频中表情的视频,同时使用中性图像中的背景。通过补充轻量级低分辨率模型,FacEnhance 在计算效率与理想图像分辨率和质量之间取得了平衡。在 MUG 面部表情数据库上的大量实验表明,FacEnhance 在保持内容和身份一致性的同时,将低分辨率模型的输出提升至最新质量。FacEnhance 代表了资源高效、高保真面部表情生成的重要进步,使过时的低分辨率方法达到最新标准。

关键词

引用

@article{arxiv.2406.09040,
  title  = {FacEnhance: Facial Expression Enhancing with Recurrent DDPMs},
  author = {Hamza Bouzid and Lahoucine Ballihi},
  journal= {arXiv preprint arXiv:2406.09040},
  year   = {2024}
}

备注

submitted to Multimedia Tools and Applications