中文

基于生成式对话网络的知识 grounded 对话数据增强

计算与语言 2022-07-26 v1

摘要

尽管丰富、开放领域的文本数据通常可用,并可能包含有趣的现象(幽默、讽刺、共情等),但大多数数据是为语言处理任务设计的,且通常呈非对话格式。在这项工作中,我们朝着使用生成式对话网络(Generative Conversational Networks, GCN)自动生成对话数据迈出了一步,旨在利用可用的语言和知识数据的广度,训练开放领域社交对话智能体。我们在 Topical Chat 数据集上,使用自动指标和人类评估者,对有无知识依据的对话评估了我们的方法。我们的结果表明,对于无知识依据的对话,GCN 可以从种子数据中泛化,生成新颖但相关性较低却更具吸引力的对话;而对于知识 grounded 对话,它能生成更具知识聚焦性、流畅性和吸引力的对话。具体而言,我们表明,在开放领域对话中仅使用 10% 的种子数据时,我们的方法在吸引力、流畅性和相关性的人类评分上表现接近使用 100% 数据的基线;而对于知识 grounded 对话,仅使用 1% 的数据即可达到同等表现。

关键词

引用

@article{arxiv.2207.11363,
  title  = {Knowledge-Grounded Conversational Data Augmentation with Generative Conversational Networks},
  author = {Yen-Ting Lin and Alexandros Papangelis and Seokhwan Kim and Dilek Hakkani-Tur},
  journal= {arXiv preprint arXiv:2207.11363},
  year   = {2022}
}

备注

Accepted at SIGDial 2022