Tgea:面向预训练语言模型文本生成的错误标注数据集与基准任务
计算与语言
2025-03-07 v1
摘要
为了深入理解预训练语言模型在文本生成中的能力并开展诊断评估,我们提出了 TGEA,一个面向预训练语言模型(PLMs)文本生成的错误标注数据集及多项基准任务。我们使用精心选择的提示词引导 GPT-2 生成候选句子,从中选取 47K 个进行错误标注。众包工作者逐一检查这些句子并检测出 12k 个错误句子。我们创建了一个错误分类体系,涵盖这些错误句子中出现的 24 种错误类型,这些错误类型根据语言学和知识(例如常识)的性质进行分类。对于 PLM 生成句子中的每个错误片段,我们还检测了与之密切相关的另一个片段。每个错误因此都被人工标注了全面的标注信息,包括错误片段、相关片段、对错误的最小修正、错误类型以及错误原因。除了完全标注的数据集外,我们还详细描述了数据采集过程、数据集的统计信息和分析。这是第一个对 PLM 生成文本具有全面标注的数据集,有助于对基于 PLM 的文本生成进行诊断评估。此外,我们将 TGEA 用作基准数据集,并提出一系列自动诊断任务,包括错误检测、错误类型分类、相关片段检测和错误原因生成,以进一步推动基于预训练语言模型生成文本的自动错误检测与纠正研究。
引用
@article{arxiv.2503.04232,
title = {Tgea: An error-annotated dataset and benchmark tasks for text generation from pretrained language models},
author = {Jie He and Bo Peng and Yi Liao and Qun Liu and Deyi Xiong},
journal= {arXiv preprint arXiv:2503.04232},
year = {2025}
}
备注
ACL 2021