中文

基于自适应样本对构建孪生神经网络的自发语音情绪识别少样本学习

机器学习 2021-09-08 v1

摘要

基于语音的机器学习(ML)被誉为一种有前景的解决方案,可用于追踪现实生活中的韵律和谱时模式,这些模式指示情绪变化,从而为认知和心理状态提供有价值的窗口。然而,在移动监测研究中标注数据的稀缺阻碍了通常依赖“数据饥渴”的基于分布的学习的 ML 模型的可靠训练。利用表演性情绪中丰富的标注语音数据,本文提出一种少样本学习方法,用于从少量标注样本中自动识别自发语音中的情绪。少样本学习通过度量学习方法和孪生神经网络实现,该方法对样本间的相对距离建模,而非依赖学习每种情绪对应分布的绝对值模式。结果表明,所提出的度量学习在四个数据集中从自发语音识别情绪是可行的,即使只有少量标注样本。它们进一步展示了所提出的度量学习优于常用的自适应方法,包括网络微调和对抗学习。本工作的发现为自发语音中人类情绪的移动监测追踪提供了基础,有助于心理健康退化的真实生活评估。

关键词

引用

@article{arxiv.2109.02915,
  title  = {Few-shot Learning in Emotion Recognition of Spontaneous Speech Using a Siamese Neural Network with Adaptive Sample Pair Formation},
  author = {Kexin Feng and Theodora Chaspari},
  journal= {arXiv preprint arXiv:2109.02915},
  year   = {2021}
}

备注

IEEE Transactions on Affective Computing, early access article. doi: 10.1109/TAFFC.2021.3109485