中文

EMO-Codec:面向情感保留的遗留与神经编解码模型深度评估

音频与语音处理 2024-07-31 v4 声音

摘要

神经编解码模型减少了语音数据传输延迟,作为语音语言模型(speech LMs)的基础标记器。保持情感信息在编解码器中至关重要,以有效的沟通和情境理解。然而,现有编解码器中情感损失的研究仍不足。本文使用主观和客观方法对神经编解码器和传统编解码器进行情感数据集(如IEMOCAP)上的评估。我们的研究确定在各种比特率情境下,哪些编解码器最能保留情感信息。我们发现使用英文和中文数据训练编解码器在保留中文情感信息方面效果有限。此外,通过这些编解码器重合成的语音会降低语音情感识别(SER)的性能,尤其是对于悲伤、抑郁、恐惧和厌恶等情感。人类听力测试确认了这些发现。这项工作指导了未来语音技术的发展,以确保新编解码器保留语音中情感信息的完整性。

关键词

引用

@article{arxiv.2407.15458,
  title  = {EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations},
  author = {Wenze Ren and Yi-Cheng Lin and Huang-Cheng Chou and Haibin Wu and Yi-Chiao Wu and Chi-Chun Lee and Hung-yi Lee and Yu Tsao},
  journal= {arXiv preprint arXiv:2407.15458},
  year   = {2024}
}