FaceEditTalker:基于面部属性编辑的可控说话头生成
计算机视觉与模式识别
2025-08-28 v2 人工智能
摘要
近期,音频驱动的说话头生成在唇部同步和情感表达方面取得了令人瞩目的成果。然而,这些方法在很大程度上忽略了面部属性编辑这一关键任务。该能力对于实现深度个性化及拓展实际应用范围不可或缺,包括用户定制的数字虚拟人、引人入胜的在线教育内容以及具有品牌特色的数字客服。在这些关键领域,灵活调整发型、配饰和细微面部特征等视觉属性,对于契合用户偏好、展现多样化品牌标识以及适应多变的情境需求至关重要。本文提出 FaceEditTalker,这是一个统一框架,能够在生成高质量、与音频同步的说话头视频的同时,实现可控的面部属性操控。我们的方法包含两个关键组件:一个图像特征空间编辑模块,用于提取语义和细节特征,并允许对表情、发型和配饰等属性进行灵活控制;以及一个音频驱动的视频生成模块,将编辑后的特征与音频引导的面部关键点相融合,以驱动基于扩散模型的生成器。该设计确保了跨帧的时间连贯性、视觉保真度与身份一致性。在公开数据集上的大量实验表明,我们的方法在唇同步精度、视频质量和属性可控性方面,取得了与代表性基线方法相当或更优的性能。项目页面:https://peterfanfan.github.io/FaceEditTalker/
引用
@article{arxiv.2505.22141,
title = {FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing},
author = {Guanwen Feng and Zhiyuan Ma and Yunan Li and Jiahao Yang and Junwei Jing and Qiguang Miao},
journal= {arXiv preprint arXiv:2505.22141},
year = {2025}
}