中文

CEval:一个用于评估反事实文本生成的基准

计算与语言 2024-08-14 v2 人工智能

摘要

反事实文本生成旨在对文本进行最小程度的修改,使其被分类为不同的类别。相关工作中数据集和指标使用的不统一,阻碍了反事实文本生成方法开发的进展评估。我们提出了 CEval,一个用于比较反事实文本生成方法的基准。CEval 统一了反事实和文本质量指标,包含了带有人类标注的常见反事实数据集、标准基线 (MICE, GDBA, CREST) 以及开源语言模型 LLAMA-2。我们的实验发现,没有一种完美的反事实文本生成方法。在反事实指标上表现优异的方法往往生成质量较低的文本,而使用简单提示的 LLM 虽能生成高质量文本,却难以满足反事实标准。通过将 CEval 作为开源 Python 库提供,我们鼓励社区贡献更多方法,并在未来的工作中保持一致的评估。

关键词

引用

@article{arxiv.2404.17475,
  title  = {CEval: A Benchmark for Evaluating Counterfactual Text Generation},
  author = {Van Bach Nguyen and Jörg Schlötterer and Christin Seifert},
  journal= {arXiv preprint arXiv:2404.17475},
  year   = {2024}
}