Re-ENACT:基于Actor-Critic策略的强化学习情感语音生成
音频与语音处理
2024-08-06 v1 人工智能
机器学习
摘要
在本文中,我们提出了第一种使用actor-critic强化学习策略来修改给定语音信号韵律特征的方法。我们的方法使用贝叶斯框架来识别重要性片段的连续区间,将给定话语的片段与人类对情感的感知联系起来。我们训练一个神经网络来产生一组伯努利随机变量的变分后验分布;我们的模型对其施加马尔可夫先验以确保连续性。从该分布中采样用于下游情感预测。此外,我们训练神经网络以情感类别作为目标变量来预测软分配。下一步,我们修改被遮蔽片段的韵律特征(音高、强度和节奏)以提高目标情感的得分。我们采用actor-critic强化学习来训练韵律修改器,通过离散化修改空间来实现。此外,它为通过WSOLA操作进行节奏操作的梯度计算问题提供了一个简单的解决方案。我们的实验表明,该框架将给定语音话语的感知情感改变为目标情感。此外,我们证明我们的统一技术与需要成对训练的监督和无监督领域中最先进的情感转换模型处于同等水平。
引用
@article{arxiv.2408.01892,
title = {Re-ENACT: Reinforcement Learning for Emotional Speech Generation using Actor-Critic Strategy},
author = {Ravi Shankar and Archana Venkataraman},
journal= {arXiv preprint arXiv:2408.01892},
year = {2024}
}
备注
7 pages, 10 figures