FaithDial:一个用于信息寻求对话的忠实基准
计算与语言
2022-10-25 v3
摘要
信息寻求对话的目标是用基于知识源的自然语言话语来回应寻求者的查询。然而,对话系统经常产生无支撑的话语,这种现象被称为幻觉。为缓解此行为,我们采用以数据为中心的解决方案,通过编辑 Wizard of Wikipedia (WoW) 基准中的幻觉回复,创建了 FaithDial,一个用于无幻觉对话的新基准。我们观察到 FaithDial 比 WoW 更忠实,同时也保持了引人入胜的对话。我们展示 FaithDial 可作为以下训练信号:i) 一个幻觉评判器,用于判别话语是否忠实,在 BEGIN 基准上相比现有对话连贯性数据集将性能提升了 12.8 的 F1 分数;ii) 高质量对话生成。我们对一系列最先进的模型进行基准测试,并提出了一种辅助对比目标,基于若干自动指标实现了最高水平的忠实性与抽象性。此外,我们发现 FaithDial 的益处可泛化到其他数据集(如 CMU-Dog 和 TopicalChat)的零样本迁移。最后,人工评估显示,在 FaithDial 上训练的模型生成的回复被认为更具可解释性、合作性和吸引力。
引用
@article{arxiv.2204.10757,
title = {FaithDial: A Faithful Benchmark for Information-Seeking Dialogue},
author = {Nouha Dziri and Ehsan Kamalloo and Sivan Milton and Osmar Zaiane and Mo Yu and Edoardo M. Ponti and Siva Reddy},
journal= {arXiv preprint arXiv:2204.10757},
year = {2022}
}
备注
TACL 2022 (20 pages, 3 figures, 10 tables)