面向具吸引力智能体的批处理循环 Q 学习用于反馈信号生成
人工智能
2019-08-07 v1 机器学习
摘要
在人-机器人交互中,智能体生成恰当的言语与非言语反馈信号(backchannel)能极大提升交互体验。反馈信号在如辅导与心理咨询等需要用户持续注意与投入的应用中尤为重要。我们在此提出一种在强化学习(RL)框架下训练机器人于人机交互中生成反馈信号的方法,目标是维持高参与度。由于通过与人类交互进行在线学习极其耗时且不切实际,我们利用记录的人-人交互数据集,并将我们的问题视为批处理强化学习问题。该数据集被用作由某行为策略获取的批数据。我们以笑声作为反馈信号进行实验,并使用基于值的技术训练智能体。特别地,我们展示了在此问题的近似值函数中使用循环层的有效性,其在部分可观测环境中提升了性能。通过离策略策略评估表明,RL 智能体预期比通过模仿学习训练出的智能体产生更高的参与度。
引用
@article{arxiv.1908.02037,
title = {Batch Recurrent Q-Learning for Backchannel Generation Towards Engaging Agents},
author = {Nusrah Hussain and Engin Erzin and T. Metin Sezgin and Yucel Yemez},
journal= {arXiv preprint arXiv:1908.02037},
year = {2019}
}
备注
8 pages, 4 figures. arXiv admin note: substantial text overlap with arXiv:1908.01618