生成式 AI 文本标注是否存在系统性偏见?
计算与语言
2025-12-10 v1 人工智能
摘要
本文考察了 GLLM 标注中的偏见,通过概念性地复现 Boukes (2024) 的手动标注。使用 various GLLMs(Llama3.1:8b、Llama3.3:70b、GPT4o、Qwen2.5:72b)结合五种不同的提示词针对五个概念(政治内容、交互性、理性、不文明、意识形态)进行标注。我们发现 GLLMs 在 F1 分数方面表现尚可,但与手动标注在流行度方面存在差异,并且会产生实质性的下游结果差异,显示出系统性偏见,即它们彼此之间的重叠度更高且更接近手动标注。F1 分数的差异未能充分解释偏见的程度。
引用
@article{arxiv.2512.08404,
title = {Are generative AI text annotations systematically biased?},
author = {Sjoerd B. Stolwijk and Mark Boukes and Damian Trilling},
journal= {arXiv preprint arXiv:2512.08404},
year = {2025}
}
备注
9 pages, 6 figures, 1 table; version submitted to the International Communication Association Annual Conference in Cape Town 2026