中文

揭示NLG评估器的阿喀琉斯之踵:一种由大语言模型驱动的统一对抗框架

计算与语言 2024-10-03 v2

摘要

自然语言生成(NLG)系统的自动评估是一个长期存在的挑战。最近的研究强调了多种与人类评估高度一致的神经指标。然而,由于为不同NLG评估任务获取对抗数据存在独特挑战,这些评估器对抗对抗扰动的鲁棒性在很大程度上仍未得到充分探索。为了解决这个问题,我们引入了AdvEval,一种针对NLG评估器的新型黑盒对抗框架。AdvEval专门用于生成在人类评估者和受害者评估器之间产生强烈分歧的数据。具体来说,受大语言模型(LLMs)在文本生成和评估方面近期成功的启发,我们采用强大的LLMs作为数据生成器和黄金评估器。对抗数据通过来自黄金评估器和受害者评估器的反馈自动优化。我们在12个受害者评估器和11个NLG数据集上进行了实验,涵盖对话、摘要和问题评估等任务。结果表明,AdvEval可以导致各种受害者指标的性能显著下降,从而验证了其有效性。

关键词

引用

@article{arxiv.2405.14646,
  title  = {Unveiling the Achilles' Heel of NLG Evaluators: A Unified Adversarial Framework Driven by Large Language Models},
  author = {Yiming Chen and Chen Zhang and Danqing Luo and Luis Fernando D'Haro and Robby T. Tan and Haizhou Li},
  journal= {arXiv preprint arXiv:2405.14646},
  year   = {2024}
}

备注

ACL24 Findings