MENLI:基于自然语言推理的鲁棒评估指标
计算与语言
2023-12-27 v5 密码学与安全
机器学习
摘要
近来提出的基于 BERT 的文本生成评估指标在标准基准上表现良好,但易受对抗攻击,例如涉及信息正确性的攻击。我们认为这(部分)源于它们是语义相似度模型。相比之下,我们开发了基于自然语言推理(NLI)的评估指标,我们认为这是一种更恰当的建模方式。我们设计了一个基于偏好的对抗攻击框架,并表明我们基于 NLI 的指标比近来的基于 BERT 的指标对攻击鲁棒得多。在标准基准上,我们基于 NLI 的指标优于现有的摘要指标,但低于 SOTA 机器翻译指标。然而,当将现有指标与我们的 NLI 指标结合时,我们既获得了更高的对抗鲁棒性(15%–30%),又获得了在标准基准上测得更高质量的指标(+5% 至 30%)。
引用
@article{arxiv.2208.07316,
title = {MENLI: Robust Evaluation Metrics from Natural Language Inference},
author = {Yanran Chen and Steffen Eger},
journal= {arXiv preprint arXiv:2208.07316},
year = {2023}
}
备注
TACL 2023 Camera-ready version; updated after proofreading by the journal