一种用于语音情感识别的预训练深度强化学习新策略
声音
2022-03-30 v2 机器学习
音频与语音处理
摘要
强化学习(RL)是一种半监督学习范式,智能体通过与环境交互进行学习。深度学习与 RL 结合提供了一种高效的学习如何与环境交互的方法,称为深度强化学习(deep RL)。深度 RL 在游戏领域(如 AlphaGo)取得了巨大成功,但其在语音情感识别(SER)等具有挑战性任务中的潜力很少被探索。用于 SER 的深度 RL 可通过动态学习面向客户查询的情感感知响应,潜在提升自动呼叫中心智能体的性能。虽然 RL 智能体所采用的策略在动作选择中起主要作用,但目前尚无专为 SER 定制的 RL 策略。此外,较长的学习周期是深度 RL 的普遍挑战,会影响 SER 的学习速度。因此,本文引入一种专为 SER 定制的新策略——“Zeta 策略”,并在深度 RL 中应用预训练以实现更快的学习率。我们还研究了跨数据集预训练,以探索在无真实环境数据可用的场景下用相似数据集预训练 RL 智能体的可行性。评估使用了 IEMOCAP 与 SAVEE 数据集,任务为识别所给语句中的四种情绪:高兴、悲伤、愤怒与中性。实验结果表明,所提出的“Zeta 策略”优于现有策略。结果也支持预训练可通过缩短预热期来减少训练时间,并对跨语料场景具有鲁棒性。
引用
@article{arxiv.2101.00738,
title = {A novel policy for pre-trained Deep Reinforcement Learning for Speech Emotion Recognition},
author = {Thejan Rajapakshe and Rajib Rana and Sara Khalifa and Björn W. Schuller and Jiajun Liu},
journal= {arXiv preprint arXiv:2101.00738},
year = {2022}
}