基于分层动作探索的深度强化学习对话生成方法
计算与语言
2023-05-16 v3 人工智能
摘要
传统上,由于自然语言动作空间庞大,对话生成采用近似动态规划并通过动作采样的贪婪策略改进。然而,由于具有高动作值的合格响应稀疏,该做法对强化学习(RL)效率低下,导致随机采样带来的改进微弱。本文给出理论分析与实验,揭示对话策略的性能与采样规模正相关。为克服此限制,我们提出一种新颖的双粒度 Q 函数,其探索最有前景的响应类别以干预采样过程。我们的方法基于细粒度层次结构提取动作,从而以更少的策略迭代达到最优。此外,我们使用离线 RL 并从为捕捉人类交互中情感细微差别而设计的多个奖励函数中学习。实证研究表明,我们的算法在自动指标与人工评估上均优于基线。进一步测试显示,我们的算法兼具可解释性与可控性,并生成具有更高期望奖励的响应。
引用
@article{arxiv.2303.13465,
title = {Deep RL with Hierarchical Action Exploration for Dialogue Generation},
author = {Itsugun Cho and Ryota Takahashi and Yusaku Yanase and Hiroaki Saito},
journal= {arXiv preprint arXiv:2303.13465},
year = {2023}
}