机器生成文本检测中的偏差识别
计算与语言
2026-04-24 v2 人工智能
摘要
文本生成能力的飞速发展伴随着对机器生成文本检测(判断给定文本是由模型生成还是由人工撰写)的同步关注。虽然检测模型表现出强劲的性能,但它们可能造成显著的负面影响。我们探索了英文机器生成文本检测系统中潜在的偏差。我们整理了一个学生作文数据集,并评估了16种不同的检测系统在四个属性上的偏差:性别、种族/族裔、英语学习者(ELL)状态和经济地位。我们使用基于回归的模型评估这些属性,以确定效应的显著性和功效,并进行子组分析。我们发现,尽管各系统之间的偏差总体上不一致,但存在几个关键问题:多个模型倾向于将弱势群体分类为机器生成文本,ELL作文更可能被分类为机器生成文本,经济弱势学生的作文被分类为机器生成文本的可能性较低,非白人ELL作文相对于其白人对应文本被不成比例地分类为机器生成文本。最后,我们进行了人工标注,发现尽管人类在检测任务上总体表现不佳,但他们在所研究的属性上没有表现出显著偏差。
引用
@article{arxiv.2512.09292,
title = {Identifying Bias in Machine-generated Text Detection},
author = {Kevin Stowe and Svetlana Afanaseva and Rodolfo Raimundo and Yitao Sun and Kailash Patil},
journal= {arXiv preprint arXiv:2512.09292},
year = {2026}
}
备注
13 pages, 2 figures, 7 tables