中文

KPT:面向 grounded 对话生成的关键词引导预训练

计算与语言 2022-12-06 v1

摘要

将外部知识融入回复生成过程对于构建更有帮助且更可靠的对话智能体至关重要。然而,收集知识 grounded 的对话往往代价高昂,这呼唤一种针对 grounded 对话生成的更好的预训练模型,该模型能针对不同知识类型良好泛化。本工作中,我们提出 KPT(Keyword-guided Pre-Training,关键词引导预训练),一种无需依赖额外知识标注、用于 grounded 对话生成的新型自监督预训练方法。具体而言,我们使用预训练语言模型提取对话中不确定性最高的词元作为关键词。利用这些关键词,我们构建两类知识并预训练一个知识 grounded 的回复生成模型,旨在处理两种不同场景:(1)知识应被忠实 grounded;(2)知识可被选择性使用。对于前者,grounding 知识由从回复中提取的关键词组成。对于后者,grounding 知识额外扩充了从同一对话中其他话语提取的关键词。由于知识从对话自身提取,KPT 可轻松应用于大量且多样的对话数据。我们考量了三个数据源(开放域、任务导向、对话式 QA),共计 2.5M 对话。我们在多种少样本知识 grounded 生成任务上进行了广泛实验,包括基于对话行为、知识图、人物描述和维基百科段落的 grounding。我们全面的实验与分析表明,KPT 在这些具有多样 grounding 知识的任务上持续优于最先进方法。

关键词

引用

@article{arxiv.2212.01739,
  title  = {KPT: Keyword-guided Pre-training for Grounded Dialog Generation},
  author = {Qi Zhu and Fei Mi and Zheng Zhang and Yasheng Wang and Yitong Li and Xin Jiang and Qun Liu and Xiaoyan Zhu and Minlie Huang},
  journal= {arXiv preprint arXiv:2212.01739},
  year   = {2022}
}

备注

Accepted by AAAI 2023