中文

Jurassic 基本(几乎)就是你所需:面向开放域对话的少样本意义到文本生成

计算与语言 2021-11-11 v2

摘要

开放域对话系统的一个挑战是需要对任意话题生成真实、高质量的回复。我们旨在提升 Athena(一个 Alexa Prize 对话系统)的质量与覆盖面。我们尝试少样本基于提示的学习,在电影、音乐、电视、体育与电子游戏领域,比较 GPT-Neo 与 Jurassic-1,涵盖领域内与跨领域、不同提示集大小(2、3、10)、不同格式,以及由 WikiData 知识图谱三元组集合或对话行为构成的意义表示。我们的评估采用 BLEURT 与人工指标,结果表明在 10-shot 提示下,Athena-Jurassic 在连贯性与语义准确性上显著更优。使用 2-shot 跨领域提示的实验导致 Athena-GPT-Neo 性能大幅下降,其语义准确性跌至 0.41,不真实幻觉率升至 12%。电子游戏领域使用对话行为的实验显示,在 10-shot 提示下两个模型均学会控制对话行为,但 Athena-Jurassic 连贯性显著更高,且不真实幻觉率仅 4%。我们的结果表明 Athena-Jurassic 生成的输出质量足以用于带真实用户的在线系统。据我们所知,这些结果首次证明少样本语义基于提示的学习能够创建可泛化至新领域、并直接从意义表示生成高质量语义可控对话回复的自然语言生成器(NLG)。

关键词

引用

@article{arxiv.2110.08094,
  title  = {Jurassic is (almost) All You Need: Few-Shot Meaning-to-Text Generation for Open-Domain Dialogue},
  author = {Lena Reed and Cecilia Li and Angela Ramirez and Liren Wu and Marilyn Walker},
  journal= {arXiv preprint arXiv:2110.08094},
  year   = {2021}
}

备注

Final Conference Proceedings version