中文

DiQAD:一种端到端开放域对话评估基准数据集

计算与语言 2023-10-26 v1

摘要

对话评估在开放域对话系统开发中起着关键作用。现有工作无法提供端到端且符合人类认知的评估数据集,它们仅提供连贯性等子指标,或对话由远离真实用户设置的标注者进行。本文中,我们发布了一个大规模对话质量评估数据集(DiQAD),用于自动评估开放域对话质量。具体而言,我们(1)基于符合人类对对话质量判断的维度建立评估标准,(2)基于这些标注标准标注真实用户间的大规模对话,其包含约 100,000 段对话。我们进行了若干实验并报告了基线在 DiQAD 上的性能作为基准。该数据集公开于 https://github.com/yukunZhao/Dataset_Dialogue_quality_evaluation。

关键词

引用

@article{arxiv.2310.16319,
  title  = {DiQAD: A Benchmark Dataset for End-to-End Open-domain Dialogue Assessment},
  author = {Yukun Zhao and Lingyong Yan and Weiwei Sun and Chong Meng and Shuaiqiang Wang and Zhicong Cheng and Zhaochun Ren and Dawei Yin},
  journal= {arXiv preprint arXiv:2310.16319},
  year   = {2023}
}

备注

Accepted to Findings of EMNLP 2023