中文

面向可迁移语音情感表示:跨语言潜在表示的损失函数研究

音频与语音处理 2022-03-29 v1 声音

摘要

近年来,语音情感识别(SER)已广泛应用于从医疗到商业领域的众多场景。除信号处理方法外,SER 现亦采用提供迁移学习可能性的深度学习技术。然而,跨语言、跨语料库及跨录音条件的泛化仍是一项开放挑战。本工作通过探索有助于可迁移性(特别是向非声调语言迁移)的损失函数来填补此空白。我们提出一种带 KL 退火变分自编码器(VAE)及一种半监督 VAE,以在数据集间获得更一致的潜在嵌入分布。为确保可迁移性,潜在嵌入的分布应在非声调语言(数据集)间相似。我们首先提出一种基于去噪自编码器的低复杂度 SER,其在四分类情感分类上取得超过 52.09% 的未加权分类准确率,该性能与类似基线方法相当。随后,我们采用 VAE、半监督 VAE 及带 KL 退火的 VAE 以获得更具正则化的潜在空间。我们表明,尽管 DAE 在方法中分类准确率最高,半监督 VAE 具有相当的分类准确率及在数据集间更一致的潜在嵌入分布。

关键词

引用

@article{arxiv.2203.14865,
  title  = {Towards Transferable Speech Emotion Representation: On loss functions for cross-lingual latent representations},
  author = {Sneha Das and Nicole Nadine Lønfeldt and Anne Katrine Pagsberg and Line H. Clemmensen},
  journal= {arXiv preprint arXiv:2203.14865},
  year   = {2022}
}

备注

Preprint of paper accepted to be presented at the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2022. Source code at https://bit.ly/34CgkSZ. arXiv admin note: text overlap with arXiv:2105.02055