中文

对话补全:将文档转化为对话

计算与语言 2022-06-02 v2 人工智能

摘要

许多重要问题(例如“如何吃得更健康?”)需要对话来建立上下文并深入探究。然而,对话式问答(ConvQA)系统长期受困于稀缺且收集昂贵的训练数据。为解决这个问题,我们提出一种合成生成多样且高质量对话数据的新技术:对话补全。我们的方法取任意文档的文本并将其转化为作者与想象读者之间的两人对话:我们将文章中的句子视为作者说出的话语,然后使用对话补全器预测想象读者在作者每句话语之间所问或所说的内容。通过将此方法应用于维基百科和网络的段落,我们生成了 WikiDialog 和 WebDialog,两个总计 1900 万条多样信息寻求对话的数据集——比最大的现有 ConvQA 数据集大 1000 倍。此外,人类评估者判断 WikiDialog 的回答充分性和对话性等同于或优于现有手动收集的数据集。使用我们的补全数据预训练 ConvQA 检索系统,我们在三个基准(QReCC、OR-QuAC、TREC CAsT)上显著推进了最先进水平,在标准评估指标上取得高达 40% 的相对提升。

关键词

引用

@article{arxiv.2205.09073,
  title  = {Dialog Inpainting: Turning Documents into Dialogs},
  author = {Zhuyun Dai and Arun Tejasvi Chaganty and Vincent Zhao and Aida Amini and Qazi Mamunur Rashid and Mike Green and Kelvin Guu},
  journal= {arXiv preprint arXiv:2205.09073},
  year   = {2022}
}