PersonaTalk:在视觉配音中关注你的角色特征
计算机视觉与模式识别
2024-09-10 v1 人工智能
图形学
摘要
对于音频驱动的视觉配音,在合成准确唇同步的同时保持并突出说话者的角色特征仍然是一个相当大的挑战。现有方法在捕获说话者独特的说话风格或保留面部细节方面存在不足。在本文中,我们提出了 PersonaTalk,一个基于注意力的两阶段框架,包括几何构建和人脸渲染,用于高保真和个性化的视觉配音。在第一阶段,我们提出了一个风格感知音频编码模块,通过交叉注意力层将说话风格注入音频特征。风格化的音频特征随后用于驱动说话者的模板几何体,以获得唇同步的几何体。在第二阶段,引入了双注意力人脸渲染器来为目标几何体渲染纹理。它由两个平行的交叉注意力层组成,即 Lip-Attention 和 Face-Attention,分别从不同的参考帧中采样纹理以渲染整个人脸。凭借我们的创新设计,复杂的面部细节可以得到很好的保留。综合实验和用户研究表明,我们在视觉质量、唇同步准确性和角色特征保持方面优于其他 SOTA 方法。此外,作为通用人物框架,PersonaTalk 可以取得与 SOTA 特定人物方法相媲美的性能。项目页面:https://grisoon.github.io/PersonaTalk/。
引用
@article{arxiv.2409.05379,
title = {PersonaTalk: Bring Attention to Your Persona in Visual Dubbing},
author = {Longhao Zhang and Shuang Liang and Zhipeng Ge and Tianshu Hu},
journal= {arXiv preprint arXiv:2409.05379},
year = {2024}
}
备注
Accepted at SIGGRAPH Asia 2024 (Conference Track)