ESARM: 基于自动排序演示的奖励模型实现3D情感语音到动画生成
计算机视觉与模式识别
2024-11-27 v2 声音
音频与语音处理
摘要
本文提出了一种新颖的3D语音到动画(STA)生成框架,旨在解决现有模型在生成多样化和情感共鸣动画方面的不足。当前的STA模型通常生成的动画缺乏情感深度和多样性,无法符合人类预期。为克服这些限制,我们引入了一种新颖的STA模型,并配以奖励模型。这种组合通过交叉耦合训练方法实现了音频条件下情感与内容的解耦。此外,我们开发了一种训练方法,利用对生成面部动画的自动质量评估来指导强化学习过程。该方法鼓励STA模型探索更广泛的可能性,从而生成多样且富有情感表现力的高质量面部动画。我们在基准数据集上进行了广泛的经验实验,结果验证了我们提出的框架在生成高质量、情感丰富的3D动画方面的有效性,这些动画更符合人类偏好。
引用
@article{arxiv.2411.13089,
title = {ESARM: 3D Emotional Speech-to-Animation via Reward Model from Automatically-Ranked Demonstrations},
author = {Xulong Zhang and Xiaoyang Qu and Haoxiang Shi and Chunguang Xiao and Jianzong Wang},
journal= {arXiv preprint arXiv:2411.13089},
year = {2024}
}
备注
This paper has issues. We have already contacted HPCC for withdrawal and now need to withdraw it from arXiv as well