通过零样本可泛化奖励函数个性化任务型对话系统
计算与语言
2023-03-27 v1 机器学习
摘要
任务型对话系统使用户能够利用自然语言完成任务。最先进的系统以相同方式响应用户,而不考虑其个性,尽管个性化对话可以带来更高的采纳率和更好的用户体验。构建个性化对话系统是一项重要但具挑战性的工作,仅有少数研究接受了该挑战。大多数现有工作依赖监督学习方法,并为每个用户画像需要费力且昂贵的标注训练数据。此外,为每个用户画像收集和标注数据几乎是不可能的。在本工作中,我们提出了一个新颖框架 P-ToD,以无监督方式使用零样本可泛化奖励函数自适应广泛用户画像,从而个性化任务型对话系统。P-ToD 使用预训练的 GPT-2 作为骨干模型,并分三个阶段工作。阶段一执行任务特定训练。阶段二通过利用近端策略优化算法启动无监督个性化,该算法在零样本可泛化奖励函数引导下执行策略梯度。我们的新颖奖励函数即使对于未见过的画像也能量化生成响应的质量。可选的最后阶段使用少量标注训练样本微调个性化模型。我们使用个性化 bAbI 对话基准在五个任务和最多 180 个多样化用户画像上进行了广泛的实验分析。实验结果表明,即使 P-ToD 零标注样本可用,也优于最先进的监督个性化模型,并与强全监督 GPT-2 基线在 BLEU 和 ROUGE 指标上取得有竞争力的性能。
引用
@article{arxiv.2303.13797,
title = {Personalizing Task-oriented Dialog Systems via Zero-shot Generalizable Reward Function},
author = {A. B. Siddique and M. H. Maqbool and Kshitija Taywade and Hassan Foroosh},
journal= {arXiv preprint arXiv:2303.13797},
year = {2023}
}
备注
11 pages, 4 tables, 31st ACM International Conference on Information and Knowledge Management (CIKM'22)