中文

xDial-Eval:一个多语言开放域对话评估基准

计算与语言 2023-10-16 v1

摘要

无参考学习型指标在开放域对话评估中的近期进展,是由预训练语言模型的进步和具有高质量人工标注的对话数据的可用性所推动的。然而,当前研究主要集中于英语对话,且这些指标对其他语言的泛化能力尚未得到充分检验。这在很大程度上归因于缺乏多语言对话评估基准。为解决该问题,我们引入了xDial-Eval,其构建于开源英语对话评估数据集之上。xDial-Eval包含12个轮次级和6个对话级英语数据集,分别由14930个标注轮次和8691个标注对话组成。英语对话数据通过商业机器翻译系统扩展至其他九种语言。在xDial-Eval上,我们对以往的基于BERT的指标和近期涌现的大语言模型进行了全面分析。最后,我们建立了强大的自监督与多语言基线。在所有数据集和语言上的平均Pearson相关系数方面,最佳基线在轮次和对话级别分别比OpenAI的ChatGPT绝对提升6.5%和4.6%,尽管其参数少得多。数据和代码公开于https://github.com/e0397123/xDial-Eval。

关键词

引用

@article{arxiv.2310.08958,
  title  = {xDial-Eval: A Multilingual Open-Domain Dialogue Evaluation Benchmark},
  author = {Chen Zhang and Luis Fernando D'Haro and Chengguang Tang and Ke Shi and Guohua Tang and Haizhou Li},
  journal= {arXiv preprint arXiv:2310.08958},
  year   = {2023}
}

备注

Accepted to EMNLP-2023 Findings