DiT-Head:基于扩散Transformer的高分辨率说话头合成
人工智能
2023-12-12 v1 计算机视觉与模式识别
机器学习
摘要
我们提出了一种名为“DiT-Head”的新型说话头合成流水线,该流水线基于扩散Transformer,并使用音频作为条件来驱动扩散模型的去噪过程。我们的方法具有可扩展性,能够泛化到多个身份,同时产生高质量的结果。我们训练并评估了所提出的方法,并将其与现有的说话头合成方法进行了比较。我们表明,我们的模型在视觉质量和唇形同步精度方面可以与这些方法相媲美。我们的结果突出了所提出的方法在广泛应用中的潜力,包括虚拟助手、娱乐和教育。有关结果的视频演示和我们的用户研究,请参阅补充材料。
关键词
引用
@article{arxiv.2312.06400,
title = {DiT-Head: High-Resolution Talking Head Synthesis using Diffusion Transformers},
author = {Aaron Mir and Eduardo Alonso and Esther Mondragón},
journal= {arXiv preprint arXiv:2312.06400},
year = {2023}
}