中文

ComperDial:面向常识人格对话数据集与基准

计算与语言 2024-06-18 v1

摘要

我们提出了一个新的基准 ComperDial,用于训练和评估开放域对话系统的评估指标。ComperDial 包含 1,485 场对话中 10,395 个对话轮次的人工打分结果,这些对话来自 99 个提交给常识人格对话(CPD)挑战的对话代理。因此,对于任意一次对话,本基准包括多个具有多样性特征的不同回复,以确保对所学对话指标的更稳健评估。除了单个回复的得分,ComperDial 还包含对对话级别的人工标注得分,使我们能够在整个对话期间对模型回复进行联合评估。最后,基于 ComperDial,我们设计了一个新的自动评估指标,用于衡量模型生成对话与人类对话之间的一般相似性。我们的实验结果表明,新的评估指标 CPDScore 与人类判断的相关性更高于现有指标。我们将 ComperDial 和 CPDScore 均向社区开放,以加速开放域对话系统自动评估指标的开发。

关键词

引用

@article{arxiv.2406.11228,
  title  = {ComperDial: Commonsense Persona-grounded Dialogue Dataset and Benchmark},
  author = {Hiromi Wakaki and Yuki Mitsufuji and Yoshinori Maeda and Yukiko Nishimura and Silin Gao and Mengjie Zhao and Keiichi Yamada and Antoine Bosselut},
  journal= {arXiv preprint arXiv:2406.11228},
  year   = {2024}
}