使用聚类动作与人类相似度奖励的深度强化学习聊天机器人
人工智能
2019-08-28 v1 计算与语言
机器学习
神经与进化计算
摘要
使用强化学习范式训练聊天机器人具有挑战性,原因在于高维状态、无限动作空间以及奖励函数难以指定。我们通过以聚类动作替代无限动作,以及一种基于从人人对话数据导出的人类相似度评分的简单而有前景的奖励函数来解决这些问题。我们在原始文本闲聊数据上训练深度强化学习(DRL)智能体——无任何人工标注。使用不同训练数据划分的实验结果如下。第一,我们的智能体在熟悉的环境中学习了合理的策略,但当暴露于未见对话的测试集时性能大幅下降。第二,在测试数据上,100至300维之间的句子嵌入大小选择无显著差异。第三,只要我们所用对话历史长度≥10句,所提出的人类相似度奖励对训练聊天机器人是合理的。
引用
@article{arxiv.1908.10331,
title = {Deep Reinforcement Learning for Chatbots Using Clustered Actions and Human-Likeness Rewards},
author = {Heriberto Cuayáhuitl and Donghyeon Lee and Seonghan Ryu and Sungja Choi and Inchul Hwang and Jihie Kim},
journal= {arXiv preprint arXiv:1908.10331},
year = {2019}
}
备注
In International Joint Conference of Neural Networks (IJCNN), 2019