中文

JoTR:一种用于对话策略学习的联合Transformer与强化学习框架

计算与语言 2023-09-04 v1

摘要

对话策略学习(DPL)是对话建模的关键组成部分,其主要作用是确定恰当的抽象回复,通常称为“对话动作”。传统DPL方法将其视为序列决策问题,使用从语料库中提取的预定义动作候选。然而,这些不完整的候选会显著限制回复的多样性,并在处理边缘情况(即仅在极端运行参数下出现的场景)时带来挑战。为解决这些局限,我们引入了新颖的框架JoTR。该框架的独特之处在于利用基于文本到文本Transformer的模型生成灵活的对话动作。与传统方法不同,JoTR制定了词级策略,无需任何动作模板即可实现更具动态性和适应性的对话动作生成。该设定增强了回复多样性并提升了系统有效处理边缘情况的能力。此外,JoTR采用带奖励塑形机制的强化学习来高效微调词级对话策略,使模型能从交互中学习并随时间改进性能。我们对JoTR进行了广泛评估,结果表明其在两个基准对话建模任务上均取得最优性能,这由用户模拟器与人工评估者共同证实。

关键词

引用

@article{arxiv.2309.00230,
  title  = {JoTR: A Joint Transformer and Reinforcement Learning Framework for Dialog Policy Learning},
  author = {Wai-Chung Kwan and Huimin Wang and Hongru Wang and Zezhong Wang and Xian Wu and Yefeng Zheng and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2309.00230},
  year   = {2023}
}

备注

Our code, models and other related resources are publicly available at https://github.com/KwanWaiChung/JoTR