中文

EMOPortraits:增强情感表达的多模态单样本头部化身

计算机视觉与模式识别 2024-05-01 v1

摘要

由视觉信号驱动的头部化身因其能够实现驱动者与动画角色不同的跨驱动合成而广受欢迎,这是一种极具挑战性但非常实用的方法。现有的 SOTA 模型 MegaPortraits 在此领域表现出色。我们对该模型进行了深入检验和评估,特别关注其面部表情描述符的潜在空间,并发现其在表达强烈面部表情方面存在局限性。为了解决这些问题,我们对训练流程和模型架构进行了重大改进,提出了我们的 EMOPortraits 模型,具体包括:增强了模型对强烈、不对称面部表情的支持能力,在情感迁移任务中取得了新的 SOTA 结果,在指标和质量上均超越了先前方法;为模型集成了语音驱动模式,在音频驱动面部动画方面达到了顶尖性能,从而可以通过视觉信号、音频或两者混合来驱动源身份。我们还发布了一个包含广泛强烈和不对称面部表情的新多视角数据集,填补了现有数据集在此类数据上的空白。

关键词

引用

@article{arxiv.2404.19110,
  title  = {EMOPortraits: Emotion-enhanced Multimodal One-shot Head Avatars},
  author = {Nikita Drobyshev and Antoni Bigata Casademunt and Konstantinos Vougioukas and Zoe Landgraf and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2404.19110},
  year   = {2024}
}