中文

利用动态联合分布自适应改进说话人无关的语音情感识别

声音 2024-01-19 v1 机器学习 音频与语音处理

摘要

在说话人无关的语音情感识别中,训练和测试样本采集自不同的说话人,导致不同说话人数据的特征分布之间存在多域偏移挑战。因此,当训练好的模型面对来自新说话人的数据时,其性能往往会下降。为解决这一问题,我们在多源域自适应框架下提出了一种动态联合分布自适应 (Dynamic Joint Distribution Adaptation, DJDA) 方法。DJDA 首先利用联合分布自适应 (Joint Distribution Adaptation, JDA),包括边缘分布自适应 (Marginal Distribution Adaptation, MDA) 和条件分布自适应 (Conditional Distribution Adaptation, CDA),以更精确地衡量由不同说话人引起的多域分布偏移。这有助于消除情感特征中的说话人偏差,从而能够从粗粒度到细粒度学习具有判别性且说话人不变的语音情感特征。此外,我们基于 A\mathcal{A}-Distance 使用动态平衡因子量化了 JDA 中 MDA 和 CDA 的自适应贡献,从而促进有效处理来自新说话人数据中遇到的未知分布。实验结果表明,与其他最先进 (SOTA) 方法相比,我们的 DJDA 表现出优越的性能。

关键词

引用

@article{arxiv.2401.09752,
  title  = {Improving Speaker-independent Speech Emotion Recognition Using Dynamic Joint Distribution Adaptation},
  author = {Cheng Lu and Yuan Zong and Hailun Lian and Yan Zhao and Björn Schuller and Wenming Zheng},
  journal= {arXiv preprint arXiv:2401.09752},
  year   = {2024}
}

备注

Accepted by ICASSP 2024