中文

释放用户反馈潜力:利用大语言模型作为用户模拟器增强对话系统

计算与语言 2023-10-20 v2

摘要

对话系统与大语言模型(LLMs)已获得相当关注。然而,研究发现直接将 LLMs 用作任务型对话(TOD)模型的表现不如较小的特定任务模型。尽管如此,必须承认 LLMs 的重要潜力并探索利用其出色能力的改进方法。受利用 LLMs 目标的驱动,我们提出一种称为用户引导响应优化(UGRO)的替代方法,将其与较小的 TOD 模型结合。该方法使用 LLM 作为无标注的用户模拟器来评估对话响应,并将其与较小的微调端到端 TOD 模型结合。通过利用 LLM 生成的满意度反馈,UGRO 进一步优化了监督微调的 TOD 模型。具体而言,TOD 模型以对话历史为输入,并在用户模拟器反馈的辅助下,生成满足用户需求的高满意度响应。通过在两个 TOD 基准上的实证实验,我们验证了方法的有效性。结果表明我们的方法优于先前的最先进(SOTA)结果。

关键词

引用

@article{arxiv.2306.09821,
  title  = {Unlocking the Potential of User Feedback: Leveraging Large Language Model as User Simulator to Enhance Dialogue System},
  author = {Zhiyuan Hu and Yue Feng and Anh Tuan Luu and Bryan Hooi and Aldo Lipani},
  journal= {arXiv preprint arXiv:2306.09821},
  year   = {2023}
}

备注

Accepted by CIKM 2023