CEval:一个用于评估反事实文本生成的基准
计算与语言
2024-08-14 v2 人工智能
摘要
反事实文本生成旨在对文本进行最小程度的修改,使其被分类为不同的类别。相关工作中数据集和指标使用的不统一,阻碍了反事实文本生成方法开发的进展评估。我们提出了 CEval,一个用于比较反事实文本生成方法的基准。CEval 统一了反事实和文本质量指标,包含了带有人类标注的常见反事实数据集、标准基线 (MICE, GDBA, CREST) 以及开源语言模型 LLAMA-2。我们的实验发现,没有一种完美的反事实文本生成方法。在反事实指标上表现优异的方法往往生成质量较低的文本,而使用简单提示的 LLM 虽能生成高质量文本,却难以满足反事实标准。通过将 CEval 作为开源 Python 库提供,我们鼓励社区贡献更多方法,并在未来的工作中保持一致的评估。
引用
@article{arxiv.2404.17475,
title = {CEval: A Benchmark for Evaluating Counterfactual Text Generation},
author = {Van Bach Nguyen and Jörg Schlötterer and Christin Seifert},
journal= {arXiv preprint arXiv:2404.17475},
year = {2024}
}