评估面向人口统计学目标的社会偏见检测:全面基准研究
计算与语言
2026-04-10 v3 计算机与社会
机器学习
摘要
用于训练通用人工智能模型的大规模网络爬取文本语料库常包含针对特定人口统计学的社会偏见,导致监管需求促使数据审计和开发可扩展偏见检测方法。尽管已有研究探讨了文本数据集中的偏见及相关检测方法,但这些研究范围有限。它们通常只关注单一内容类型(如仇恨言论),覆盖有限的人口统计学维度,忽略影响多个人口统计学的偏见,以及分析有限的技术。因此,实践者缺乏对近期大语言模型(LLM)用于自动化偏见检测能力的全面理解。本研究开展了针对英文文本的全面基准研究,以评估 LLM 在检测人口统计学目标社会偏见方面的能力。为符合监管要求,我们将偏见检测定义为使用人口统计学聚焦分类学的多标签任务,以检测被针对的身份。我们随后系统评估了模型在不同规模和技术上的表现,包括提示、情境学习和微调。我们使用覆盖多种内容类型和人口统计学的十二个数据集,展示了针对可扩展检测的微调小型模型的潜力。然而,我们的分析也暴露了在人口统计学维度和多人口统计学目标偏见方面的持续差距,凸显了需要更有效和可扩展的检测框架的必要性。
引用
@article{arxiv.2510.04641,
title = {Evaluating LLMs for Demographic-Targeted Social Bias Detection: A Comprehensive Benchmark Study},
author = {Ayan Majumdar and Feihao Chen and Jinghui Li and Xiaozhen Wang},
journal= {arXiv preprint arXiv:2510.04641},
year = {2026}
}
备注
19 pages