中文

奇妙的奖励及其驯服:面向任务型对话系统的奖励学习案例研究

计算与语言 2023-02-22 v1

摘要

在学习任务型对话(ToD)智能体时,强化学习(RL)技术可自然用于训练对话策略以实现用户特定目标。先前工作主要聚焦于采用先进RL技术训练ToD智能体,而奖励函数的设计未被充分研究。本文旨在回答如何高效学习并利用奖励函数训练端到端(E2E)ToD智能体。具体而言,受经典学习排序文献启发,我们引入两个用于奖励函数学习的广义目标。进而,我们利用习得的奖励函数引导E2E ToD智能体的训练。借助所提技术,我们在Multiwoz 2.0数据集的E2E响应生成任务上取得了具竞争力的结果。源代码与检查点已公开发布于https://github.com/Shentao-YANG/Fantastic_Reward_ICLR2023。

关键词

引用

@article{arxiv.2302.10342,
  title  = {Fantastic Rewards and How to Tame Them: A Case Study on Reward Learning for Task-oriented Dialogue Systems},
  author = {Yihao Feng and Shentao Yang and Shujian Zhang and Jianguo Zhang and Caiming Xiong and Mingyuan Zhou and Huan Wang},
  journal= {arXiv preprint arXiv:2302.10342},
  year   = {2023}
}

备注

Published as a conference paper at ICLR 2023