中文

SODA:结合社会常识语境的百万规模对话蒸馏

计算与语言 2023-10-25 v3

摘要

数据稀缺一直是开放域社交对话领域长期存在的问题。为缓解这一问题,我们提出了 SODA:首个公开可用的百万规模高质量社交对话数据集。通过将知识图谱中的社会常识知识语境化,我们能够从大型语言模型中蒸馏出异常广泛的社交互动。人类评估表明,SODA 中的对话比以往人工编写数据集中的对话更具一致性、更具体,且(令人惊讶地)更自然。使用 SODA,我们训练了 COSMO:一个具有泛化能力的对话模型,在未见过的数据集上比表现最好的对话模型(如 GODEL、BlenderBot-1、Koala、Vicuna)显著更自然、更一致。实验表明,COSMO 有时甚至比原始的人工撰写黄金回复更受青睐。此外,我们的结果揭示了知识增强对话与自然社交闲聊之间的区别。我们计划公开我们的数据、模型和代码。

关键词

引用

@article{arxiv.2212.10465,
  title  = {SODA: Million-scale Dialogue Distillation with Social Commonsense Contextualization},
  author = {Hyunwoo Kim and Jack Hessel and Liwei Jiang and Peter West and Ximing Lu and Youngjae Yu and Pei Zhou and Ronan Le Bras and Malihe Alikhani and Gunhee Kim and Maarten Sap and Yejin Choi},
  journal= {arXiv preprint arXiv:2212.10465},
  year   = {2023}
}

备注

EMNLP 2023. Dataset, model, and code can be found at https://hyunw.kim/sodaverse