中文

Scheduled Curiosity-Deep Dyna-Q:对话策略学习的高效探索

机器学习 2024-05-21 v2 人工智能

摘要

基于强化学习训练任务导向型对话智能体耗时且需要大量与真实用户的交互。如何在有限的对话经验中掌握对话策略,仍然是导致智能体训练过程效率较低的障碍。此外,大多数先前框架通过随机选择训练样本来开始训练,这与人类学习方法不同,并损害了训练的效率和稳定性。因此,我们提出了 Scheduled Curiosity-Deep Dyna-Q (SC-DDQ),这是一个基于最先进的基于模型的强化学习对话模型 Deep Dyna-Q (DDQ) 的好奇心驱动课程学习框架。此外,我们遵循两种相反的训练策略(经典课程学习及其反向版本),分别为 SC-DDQ 和 DDQ 设计了学习调度。我们的结果表明,通过引入调度学习和好奇心,新框架相较于 DDQ 和 Deep Q-learning (DQN) 带来了显著提升。令人惊讶的是,我们发现传统的课程学习并非总是有效。具体而言,根据实验结果,先易后难和先难后易的策略分别更适合 SC-DDQ 和 DDQ。为了分析我们的结果,我们采用采样动作的熵来描绘动作探索,并发现第一阶段高熵、最后阶段低熵的训练策略能带来更好的性能。

关键词

引用

@article{arxiv.2402.00085,
  title  = {Scheduled Curiosity-Deep Dyna-Q: Efficient Exploration for Dialog Policy Learning},
  author = {Xuecheng Niu and Akinori Ito and Takashi Nose},
  journal= {arXiv preprint arXiv:2402.00085},
  year   = {2024}
}

备注

Accepted to IEEE Access