DynaEval:统一话语级与对话级评估
计算与语言
2021-06-08 v3
摘要
对话本质上是说话者之间的多轮交互。有效的评估指标应反映这种交互的动态性。现有自动指标非常关注话语级质量,却忽略了这种动态性。为此,我们提出 DynaEval,一个统一的自动评估框架,其不仅能进行话语级评估,还从整体考虑整个对话的质量。在 DynaEval 中,采用图卷积网络(GCN)对对话整体建模,其中图节点表示每个独立话语,边表示话语对之间的依赖关系。随后应用对比损失以区分构造良好的对话与精心构造的负样本。实验表明,DynaEval 显著优于最先进的对话连贯性模型,并在话语级和对话级多个对话评估方面与人类判断强相关。
引用
@article{arxiv.2106.01112,
title = {DynaEval: Unifying Turn and Dialogue Level Evaluation},
author = {Chen Zhang and Yiming Chen and Luis Fernando D'Haro and Yan Zhang and Thomas Friedrichs and Grandee Lee and Haizhou Li},
journal= {arXiv preprint arXiv:2106.01112},
year = {2021}
}
备注
ACL-IJCNLP 2021 (Main conference, Long paper)