Beemo:专家编辑的机器生成输出基准
计算与语言
2025-03-18 v3
摘要
大型语言模型(LLM)的快速普及增加了机器生成文本(MGT)的数量,并在各领域模糊了文本的作者身份。然而,大多数现有的MGT基准仅包含单作者文本(人工撰写和机器生成)。这种传统设计未能捕捉更实际的多作者场景,即用户对LLM的回答进行润色以实现自然流畅、连贯性和事实正确性。本文提出了专家编辑机器生成输出基准(Beemo),其中包含6.5k篇文本,这些文本由人工撰写、由十种指令微调LLM生成,并由专家针对各种用例进行编辑,涵盖从创意写作到摘要的多种场景。Beemo还包含13.1k篇机器生成和LLM编辑的文本,允许在不同编辑类型下进行多样化的MGT检测评估。我们记录了Beemo的创建协议,并展示了在不同实验设置下对33种MGT检测器配置进行基准测试的结果。我们发现基于专家的编辑能够规避MGT检测,而LLM编辑的文本不太可能被识别为人工撰写。Beemo及所有材料均公开可用。
引用
@article{arxiv.2411.04032,
title = {Beemo: Benchmark of Expert-edited Machine-generated Outputs},
author = {Ekaterina Artemova and Jason Lucas and Saranya Venkatraman and Jooyoung Lee and Sergei Tilga and Adaku Uchendu and Vladislav Mikhailov},
journal= {arXiv preprint arXiv:2411.04032},
year = {2025}
}
备注
Accepted to NAACL 2025