基于奖励驱动知识选择的知识 grounded 对话
计算与语言
2021-09-01 v1
摘要
知识 grounded 对话是一项基于对话上下文和一组外部知识生成流畅且信息丰富的响应的任务,其中知识选择起着重要作用并吸引越来越多研究兴趣。然而,大多数现有模型要么只选择一条知识,要么使用所有知识来生成响应。前者可能丢失被丢弃知识中的有价值信息,而后者可能引入大量噪声。同时,许多方法需要使用指示真值知识的知识标签来训练知识选择器,但这些标签难以获取且需要大量人工标注。受这些问题驱动,我们提出 Knoformer,一种基于强化学习的对话响应生成模型,可自动从知识池中选中一条或多条相关知识,且在训练时不需要知识标签。Knoformer 在两个知识引导对话数据集上进行了评估,并取得了最先进(SOTA)性能。
引用
@article{arxiv.2108.13686,
title = {Knowledge-Grounded Dialogue with Reward-Driven Knowledge Selection},
author = {Shilei Liu and Xiaofeng Zhao and Bochao Li and Feiliang Ren},
journal= {arXiv preprint arXiv:2108.13686},
year = {2021}
}
备注
NLPCC 2021