NLP中的算法公平性:基于人格化大语言模型的人类中心化仇恨言论检测
计算与语言
2025-10-23 v1 计算机与社会
摘要
本文探讨了通过与注释者人格化(Persona-LLMs)来影响大语言模型对仇恨言论敏感性的机制,尤其关注与被检测对象共享或不同身份之间的偏见。为此,我们采用Google的Gemini和OpenAI的GPT-4.1-mini模型,并使用两种人格化提示方法:浅层人格化提示和基于检索增强生成(RAG)的深层人格化开发,以更丰富的人格轮廓进行整合。我们分析了使用同群体和异群体注释者人格对模型检测性能和公平性产生的影响。本工作将心理学关于群体身份的洞见与先进的NLP技术相结合,表明将社会人口统计属性纳入大语言模型可有助于缓解自动仇恨言论检测中的偏见。我们的结果突显了基于人格化方法在减少偏见方面的潜力与局限,为开发更公平的仇恨言论检测系统提供了宝贵的见解。
引用
@article{arxiv.2510.19331,
title = {Algorithmic Fairness in NLP: Persona-Infused LLMs for Human-Centric Hate Speech Detection},
author = {Ewelina Gajewska and Arda Derbent and Jaroslaw A Chudziak and Katarzyna Budzynska},
journal= {arXiv preprint arXiv:2510.19331},
year = {2025}
}
备注
This paper has been accepted for the upcoming 59th Hawaii International Conference on System Sciences (HICSS-59), 2026, Hawaii, USA. The final published version will appear in the official conference proceedings