中文

基于条件序列生成对抗网络的语音驱动富有表现力的说话唇形

人机交互 2023-05-15 v1

摘要

发音、情感和个性在口面部运动中起重要作用。为提升虚拟代理(VAs)的自然度与表现力,仔细建模这些因素间的复杂相互作用十分重要。本文提出一种称为条件序列 GAN(CSG)的条件生成对抗网络,以原则性方式学习情感与词汇内容间的关系。该模型使用直接从语音信号提取的一组发音与情感特征作为条件输入,生成逼真运动。该方法的一个关键特征是它是无需转录文本的语音驱动框架。我们的实验在客观与主观评价上显示了该模型优于三种 SOTA 基线。当目标情感已知时,我们提出通过用目标情感数据适配基础模型(CSG-Emo-Adapted)或将情感条件作为模型输入(CSG-Emo-Aware)来创建情感相关模型。这些模型的客观评价显示 CSG-Emo-Adapted 相较 CSG 模型有所改进,因为轨迹序列更接近原始序列。主观评价显示当目标情感为快乐时,该模型相较 CSG 模型结果显著更好。

关键词

引用

@article{arxiv.1806.00154,
  title  = {Speech-Driven Expressive Talking Lips with Conditional Sequential Generative Adversarial Networks},
  author = {Najmeh Sadoughi and Carlos Busso},
  journal= {arXiv preprint arXiv:1806.00154},
  year   = {2023}
}