中文

面向特定领域的跨语料库语音情感识别方法

声音 2023-12-12 v1 音频与语音处理

摘要

跨语料库语音情感识别(SER)由于特征分布不匹配而面临挑战,可能降低现有SER方法的性能。在本文中,我们通过提出一种新颖的迁移子空间学习方法,即声学知识引导的迁移线性回归(AKTLR),来应对这一挑战。与现有方法不同,现有方法通常忽略与SER相关的领域特定知识,而简单地将跨语料库SER视为通用的迁移学习任务,我们的AKTLR方法建立在一个精心设计的声学知识引导的双重稀疏约束机制之上。该机制强调了使用极简声学参数特征集来缓解分类器过度适应的潜力,这是SER中经验验证的声学知识,与使用大型特征集相比,能够在跨语料库SER任务中实现更优越的泛化能力。通过这一机制,我们将一个简单的迁移线性回归模型扩展为AKTLR。这种扩展充分利用了其从用于描述语音信号的既定声学参数特征集中,在两个尺度上寻找情感判别性和语料库不变性特征的能力:贡献性声学参数组和每个贡献组内的构成元素。我们提出的方法通过在三个广泛使用的语音情感语料库:EmoDB、eNTERFACE和CASIA上进行广泛的跨语料库SER实验来评估。结果证实了我们方法的有效性和优越性能,优于近期最先进的迁移子空间学习和基于深度迁移学习的跨语料库SER方法。此外,我们的工作提供了实验证据,支持将领域特定知识融入迁移学习模型以解决跨语料库SER任务的可行性和优越性。

关键词

引用

@article{arxiv.2312.06466,
  title  = {Towards Domain-Specific Cross-Corpus Speech Emotion Recognition Approach},
  author = {Yan Zhao and Yuan Zong and Hailun Lian and Cheng Lu and Jingang Shi and Wenming Zheng},
  journal= {arXiv preprint arXiv:2312.06466},
  year   = {2023}
}