FacEDiT:基于面部运动填充的统一说话面部编辑与生成
计算机视觉与模式识别
2025-12-17 v1 人工智能
摘要
说话面部编辑和面脸生成往往被视为两个独立的问题。本文提出将二者视为统一形式化任务——语音条件面部运动填充。我们将面部运动填充视为一种自监督预文本任务,同时作为动态说话面部合成的统一形式化。为实现这一想法,我们提出FacEDiT,一个基于语音条件的扩散Transformer,通过流匹配进行训练。灵感来自掩码自编码器,FacEDiT学习在语音条件下,对被遮盖的面部运动进行合成,依赖于周围的运动。这种形式化使我们能够实现局部生成和编辑,如替换、插入和删除,同时确保与未编辑区域的无缝衔接。此外,偏置注意力和时间平滑约束增强了边界连续性和唇部同步。为解决缺乏标准编辑基准的问题,我们引入FacEDiTBench,首个针对说话面部编辑的数据集,包含多样化的编辑类型和长度,以及新的评估指标。广泛的实验验证了说话面部编辑和生成作为语音条件运动填充子任务的观点;FacEDiT产生准确、语音对齐的面部编辑,保持身份识别并实现视觉连续性,同时在说话面部生成上表现出色。
引用
@article{arxiv.2512.14056,
title = {FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling},
author = {Kim Sung-Bin and Joohyun Chang and David Harwath and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2512.14056},
year = {2025}
}
备注
Project page: https://facedit.github.io/