对话系统中归因评估:BEGIN 基准
计算与语言
2022-06-29 v3
摘要
由大语言模型驱动的知识 grounded 对话系统常生成流畅但无法归因于相关信息的回复。朝着不表现此问题的模型取得的进展需要能够量化其普遍程度的评估指标。为此,我们引入了 Grounded INteraction 评估基准(BEGIN),其由在三个知识 grounded 对话语料库上训练的神经对话系统生成的 12k 个对话轮次组成。我们收集了人工标注,评估模型回复可归因于给定背景信息的程度。然后我们使用 BEGIN 分析八项评估指标。我们发现这些指标依赖虚假相关性,不能可靠区分可归因的抽象式回复与不可归因的回复,并且在知识源更长时表现明显更差。我们的发现强调了需要更复杂且鲁棒的知识 grounded 对话评估指标。我们在 https://github.com/google/BEGIN-dataset 公开提供 BEGIN。
引用
@article{arxiv.2105.00071,
title = {Evaluating Attribution in Dialogue Systems: The BEGIN Benchmark},
author = {Nouha Dziri and Hannah Rashkin and Tal Linzen and David Reitter},
journal= {arXiv preprint arXiv:2105.00071},
year = {2022}
}
备注
TACL, 12 pages, 9 figures, 2 tables