EmoRL:基于深度强化学习的连续声学情感分类
机器人学
2018-04-12 v1 计算与语言
人机交互
机器学习
摘要
声学表达的情感可使与机器人的通信更高效。检测如愤怒等情感可为机器人提供指示不安全/不期望情况的线索。近来,若干基于深度神经网络的模型被提出,在情感状态评估中确立了新的 SOTA 结果。这些模型通常在每个话语结束时开始处理,这不仅需要检测话语结束的机制,也使其难以用于实时通信场景,例如人机交互。我们提出 EmoRL 模型,其在聆听人说话过程中一旦获得足够置信度即触发情感分类。因此,我们最小化了对音频信号进行分割以分类的需求,并因音频信号被增量处理而实现了更低延迟。该方法在与强基线模型准确率相当的同时,允许早得多地进行预测。
引用
@article{arxiv.1804.04053,
title = {EmoRL: Continuous Acoustic Emotion Classification using Deep Reinforcement Learning},
author = {Egor Lakomkin and Mohammad Ali Zamani and Cornelius Weber and Sven Magg and Stefan Wermter},
journal= {arXiv preprint arXiv:1804.04053},
year = {2018}
}
备注
Accepted to the IEEE International Conference on Robotics and Automation (ICRA'18), Brisbane, Australia, May 21-25, 2018