中文

DynaEval:统一话语级与对话级评估

计算与语言 2021-06-08 v3

摘要

对话本质上是说话者之间的多轮交互。有效的评估指标应反映这种交互的动态性。现有自动指标非常关注话语级质量,却忽略了这种动态性。为此,我们提出 DynaEval,一个统一的自动评估框架,其不仅能进行话语级评估,还从整体考虑整个对话的质量。在 DynaEval 中,采用图卷积网络(GCN)对对话整体建模,其中图节点表示每个独立话语,边表示话语对之间的依赖关系。随后应用对比损失以区分构造良好的对话与精心构造的负样本。实验表明,DynaEval 显著优于最先进的对话连贯性模型,并在话语级和对话级多个对话评估方面与人类判断强相关。

关键词

引用

@article{arxiv.2106.01112,
  title  = {DynaEval: Unifying Turn and Dialogue Level Evaluation},
  author = {Chen Zhang and Yiming Chen and Luis Fernando D'Haro and Yan Zhang and Thomas Friedrichs and Grandee Lee and Haizhou Li},
  journal= {arXiv preprint arXiv:2106.01112},
  year   = {2021}
}

备注

ACL-IJCNLP 2021 (Main conference, Long paper)