BMX:利用可解释性增强自然语言生成指标
计算与语言
2024-02-20 v2
摘要
最先进的自然语言生成评估指标基于黑盒语言模型。因此,近期工作考虑了它们的可解释性,目标是实现更好的人类可理解性和更好的指标分析(包括失败案例)。相比之下,我们提出的方法 BMX:利用可解释性增强自然语言生成指标,明确利用解释来提升指标的性能。具体而言,我们将特征重要性解释视为词级分数,并通过幂平均将其转换为片段级分数。然后,我们将此片段级分数与原始指标相结合,以获得更好的指标。我们的测试表明,在机器翻译和摘要数据集上,多个指标均有所改善。虽然机器翻译方面的改进较小,但在摘要方面的改进非常显著。值得注意的是,使用 LIME 解释器和预选参数的 BMX 在 SummEval 的系统级评估中,Spearman 相关系数平均提高了 0.087 分。
引用
@article{arxiv.2212.10469,
title = {BMX: Boosting Natural Language Generation Metrics with Explainability},
author = {Christoph Leiter and Hoa Nguyen and Steffen Eger},
journal= {arXiv preprint arXiv:2212.10469},
year = {2024}
}
备注
Accepted to Findings of EACL 2024