中文

面向音频驱动说话头生成的高效情感适配方法

声音 2023-10-13 v2 计算机视觉与模式识别 图形学 音频与语音处理

摘要

音频驱动说话头合成是虚拟人相关应用中的热门研究课题。然而,现有方法缺乏灵活性与效率,需通过昂贵的端到端训练将引导视频中的情感迁移至说话头预测,这是其显著局限。本工作中,我们提出音频驱动说话头情感适配(EAT)方法,通过参数高效适配以低成本、高效率的方式将无情感说话头模型转化为情感可控模型。我们的方法利用预训练的无情感说话头transformer,并从不同视角引入三种轻量适配(深度情感提示、情感形变网络与情感适配模块)以实现精确且真实的情感控制。实验表明,我们的方法在LRW和MEAD等广泛使用的基准上取得了最先进(SOTA)性能。此外,我们的参数高效适配展现出卓越的泛化能力,即便在情感训练视频稀缺或不存在的场景下亦然。项目主页:https://yuangan.github.io/eat/

关键词

引用

@article{arxiv.2309.04946,
  title  = {Efficient Emotional Adaptation for Audio-Driven Talking-Head Generation},
  author = {Yuan Gan and Zongxin Yang and Xihang Yue and Lingyun Sun and Yi Yang},
  journal= {arXiv preprint arXiv:2309.04946},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Project page: https://yuangan.github.io/eat/