中文

从沙中淘更多金:利用含噪自检索生成精炼开放域对话训练

计算与语言 2022-09-16 v2

摘要

真实人类对话数据复杂、异构且含噪,据此构建开放域对话系统仍是一项挑战性任务。事实上,此类对话数据仍蕴含丰富的信息与知识,然而它们未被充分挖掘。在本文中,我们指出已有的开放域对话生成方法通过自回归或编码-解码语言模型记忆上下文-回复配对数据,未能充分利用训练数据。与当前使用外部知识的方法不同,我们探索了一种检索-生成训练框架,该框架通过将异构且含噪的训练数据视为“证据”来利用其优势。具体而言,我们使用 BERTScore 进行检索,从而获得更高质量的 evidence 与生成结果。在公开数据集上的实验表明,即便此类训练数据通常被认为是低质量数据,我们的方法仍能帮助模型生成更好的回复。这种性能提升与通过扩大训练集所获得的提升相当,甚至更优。我们还发现模型性能与检索到的证据的相关性呈正相关。此外,我们的方法在零样本实验中表现良好,这表明我们的方法对真实世界数据更具鲁棒性。

关键词

引用

@article{arxiv.2201.11367,
  title  = {Pan More Gold from the Sand: Refining Open-domain Dialogue Training with Noisy Self-Retrieval Generation},
  author = {Yihe Wang and Yitong Li and Yasheng Wang and Fei Mi and Pingyi Zhou and Xin Wang and Jin Liu and Xin Jiang and Qun Liu},
  journal= {arXiv preprint arXiv:2201.11367},
  year   = {2022}
}

备注

Accepted in COLING 2022