利用语音 PTM、文本 LLM 与情感 TTS 提升语音情感识别
计算与语言
2024-10-28 v1 人工智能
声音
音频与语音处理
摘要
在本文中,我们探索了如何利用最先进的语音预训练模型(PTM)data2vec、文本生成技术 GPT-4 以及语音合成技术 Azure TTS 来提升语音情感识别(SER)。首先,我们研究了不同语音自监督预训练模型的表征能力,发现 data2vec 在 SER 任务上具有良好的表征能力。其次,我们采用强大的大语言模型(LLM)GPT-4 和情感文本转语音(TTS)模型 Azure TTS 来生成情感一致文本与语音。我们精心设计了文本提示与数据集构建,以获得高质量的合成情感语音数据。第三,我们研究了不同的数据增强方式,借助合成语音促进 SER 任务,包括随机混合、对抗训练、迁移学习和课程学习。在 IEMOCAP 数据集上的实验与消融研究证明了我们的方法相对于其他数据增强方法及其他合成数据的数据增强的有效性。
引用
@article{arxiv.2309.10294,
title = {Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition},
author = {Ziyang Ma and Wen Wu and Zhisheng Zheng and Yiwei Guo and Qian Chen and Shiliang Zhang and Xie Chen},
journal= {arXiv preprint arXiv:2309.10294},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication