基于深度神经网络的人机交互语音情感识别鲁棒性研究
机器人学
2018-04-09 v1 计算与语言
人机交互
声音
音频与语音处理
摘要
语音情感识别(SER)是人机高效协作的重要方面,并受到研究界的广泛关注。例如,近来提出了许多基于神经网络的架构,将性能推向新高度。然而,此类仅在域内数据上训练的神经SER模型在噪声条件下的适用性目前研究不足。在本工作中,我们评估了最先进的神经声学情感识别模型在人机交互场景中的鲁棒性。我们假设机器人的本征噪声、房间条件以及家庭环境中可能发生的各种声学事件会显著影响模型性能。我们在iCub机器人平台上进行了若干实验,并提出了几种缩小模型在训练与真实条件测试期间性能差距的新方法。此外,我们观察到机器上模型性能的大幅提升,并证明了引入若干数据增强技术(如叠加背景噪声与响度变化)以提升神经方法鲁棒性的必要性。
引用
@article{arxiv.1804.02173,
title = {On the Robustness of Speech Emotion Recognition for Human-Robot Interaction with Deep Neural Networks},
author = {Egor Lakomkin and Mohammad Ali Zamani and Cornelius Weber and Sven Magg and Stefan Wermter},
journal= {arXiv preprint arXiv:1804.02173},
year = {2018}
}
备注
Submitted to IROS'18, Madrid, Spain