中文

层还是表示空间:是什么让基于 BERT 的评估指标具有鲁棒性?

计算与语言 2022-09-08 v2

摘要

近期基于嵌入的文本生成评估指标的评价,主要基于测量其与标准基准上人类评估的相关性。然而,这些基准大多与用于预训练词嵌入的领域相似。这引发了人们对基于嵌入的指标在包含与预训练数据不同词汇的新颖且含噪领域中的(缺乏)泛化能力的担忧。在本文中,我们考察了 BERTScore(最受欢迎的基于嵌入的文本生成指标之一)的鲁棒性。我们表明:(a) 在标准基准上与人类评估相关性最高的基于嵌入的指标,在输入噪声或未知词元数量增加时可能具有最低的相关性;(b) 取预训练模型第一层的嵌入可改善所有指标的鲁棒性;(c) 当使用预训练模型第一层的字符级嵌入而非基于词元的嵌入时,可达到最高鲁棒性。

关键词

引用

@article{arxiv.2209.02317,
  title  = {Layer or Representation Space: What makes BERT-based Evaluation Metrics Robust?},
  author = {Doan Nam Long Vu and Nafise Sadat Moosavi and Steffen Eger},
  journal= {arXiv preprint arXiv:2209.02317},
  year   = {2022}
}

备注

COLING 2022 camera-ready version