中文

FineD-Eval:细粒度自动对话级评估

计算与语言 2022-11-01 v2

摘要

近期基于模型的无参考开放域对话评估度量与人类判断展现出良好的相关性。然而,它们要么执行轮次级评估,要么仅关注单一对话质量维度。人们期望一个好的评估度量能在对话层级评估多个质量维度。为此,我们致力于提出一种多维对话级度量,其由三个子度量组成,每个子度量针对一个特定维度。这些子度量以新颖的自监督目标进行训练,并在各自维度上展现出与人类判断的强相关性。此外,我们探索了两种结合子度量的方法:度量集成与多任务学习。两种方法均产生出显著优于单个子度量的整体度量。与现有最先进度量相比,组合度量在三个高质量对话级评估基准上平均实现约16%的相对提升。

关键词

引用

@article{arxiv.2210.13832,
  title  = {FineD-Eval: Fine-grained Automatic Dialogue-Level Evaluation},
  author = {Chen Zhang and Luis Fernando D'Haro and Qiquan Zhang and Thomas Friedrichs and Haizhou Li},
  journal= {arXiv preprint arXiv:2210.13832},
  year   = {2022}
}

备注

EMNLP-2022, 20 pages