基于扩散模型的文本驱动人脸编辑:MuseFace
计算机视觉与模式识别
2025-04-01 v1 人工智能
摘要
人脸编辑修改人脸外观,在个性化和增强个人图像方面发挥着关键作用。尽管已有许多工作在文本驱动人脸编辑方面取得了显著进展,但它们仍面临诸多挑战,由于没有任何方法同时满足多样性、可控性和灵活性三个特征。为此,我们提出MuseFace,一个文本驱动人脸编辑框架,仅依赖文本提示即可实现人脸编辑。具体而言,MuseFace集成了文本到掩码扩散模型和语义感知人脸编辑模型,能够直接从文本生成细粒度语义掩码,并执行人脸编辑。文本到掩码扩散模型为框架提供了多样性和灵活性,而语义感知人脸编辑模型确保了框架的可控性。我们的框架可创建细粒度语义掩码,从而实现精确人脸编辑,显著提升人脸编辑模型的可控性和灵活性。广泛的实验表明,MuseFace在实现卓越的高保真性能方面具有优势。
引用
@article{arxiv.2503.23888,
title = {MuseFace: Text-driven Face Editing via Diffusion-based Mask Generation Approach},
author = {Xin Zhang and Siting Huang and Xiangyang Luo and Yifan Xie and Weijiang Yu and Heng Chang and Fei Ma and Fei Yu},
journal= {arXiv preprint arXiv:2503.23888},
year = {2025}
}
备注
6 pages, 5 figures,IEEE International Conference on Multimedia & Expo 2025