作为通信游戏的推荐:面向目标对话的自监督 Bot-Play
计算与语言
2019-09-10 v1 人工智能
摘要
传统推荐系统产生静态而非交互式的推荐,不随用户的具体请求、澄清或当前情绪而变化,并且若用户偏好未知还会遭遇冷启动问题。若转而将推荐视为一项交互式对话任务,则可得以缓解:专家推荐者可以依次询问他人偏好、对其请求作出反应并推荐更合适的条目。本工作中,我们收集了一个目标驱动的推荐对话数据集(GoRecDial),包含 9125 个对话游戏以及成对人类工作者互相推荐电影所进行的 81260 轮对话。该任务被专门设计为两名玩家朝向可量化共同目标努力的合作游戏。我们利用该数据集开发了一个能够同时对话与推荐的端到端对话系统。模型首先被训练以模仿人类玩家的行为而不考虑任务目标本身(监督训练)。随后我们在两个配对的预训练模型(bot-play)之间的模拟 bot-bot 对话上对我们的模型进行微调,以达成对话目标。我们的实验表明,经 bot-play 微调的模型学到了改进的对话策略,在与人类配对时更常达成对话目标,并且相比未经 bot-play 训练的模型被人类评价为更一致。数据集与代码通过 ParlAI 框架公开可用。
引用
@article{arxiv.1909.03922,
title = {Recommendation as a Communication Game: Self-Supervised Bot-Play for Goal-oriented Dialogue},
author = {Dongyeop Kang and Anusha Balakrishnan and Pararth Shah and Paul Crook and Y-Lan Boureau and Jason Weston},
journal= {arXiv preprint arXiv:1909.03922},
year = {2019}
}
备注
EMNLP 2019