探究预训练语言模型对对话评估的影响
计算与语言
2021-11-03 v2
摘要
近年来,将预训练语言模型(Pr-LM)应用于开放域对话自动评估的兴趣激增。Pr-LM 为解决多域评估挑战提供了一条有前景的方向。然而,不同 Pr-LM 对自动度量性能的影响尚不清晰。本文考察了 8 种不同的 Pr-LM,并研究了它们在三个不同对话评估基准上对三种典型自动对话评估度量的影响。具体而言,我们分析了 Pr-LM 的选择如何影响自动度量的性能。对每个度量进行了广泛的相关性分析,以评估不同 Pr-LM 在多个维度上的效应,包括预训练目标、对话评估准则、模型规模和跨数据集鲁棒性。本研究是首个关于不同 Pr-LM 对自动对话评估影响 Comprehensive 评估的工作。
引用
@article{arxiv.2110.01895,
title = {Investigating the Impact of Pre-trained Language Models on Dialog Evaluation},
author = {Chen Zhang and Luis Fernando D'Haro and Yiming Chen and Thomas Friedrichs and Haizhou Li},
journal= {arXiv preprint arXiv:2110.01895},
year = {2021}
}
备注
Accepted by IWSDS2021 (Long Paper)