隐性影响:通过人格工程探讨大型语言模型中的隐性交叉性偏见
计算与语言
2026-04-09 v1 人工智能
摘要
大型语言模型(LLM)在类人语言生成方面表现出色,但常在人格驱动情境下嵌入并放大隐性、交叉性偏见。现有偏见审计依赖于静态、嵌入式测试(CEAT、I-WEAT、I-SEAT),这些测试量化绝对关联强度。我们表明,这些方法在捕捉模型采用社会角色时动态偏见变化方面存在局限。为此,我们引入偏差放大差异与可解释性分数(BADx):一种新型、可扩展的度量标准,用于衡量人格诱导的偏差放大并整合局部可解释性见解。BADx包含三个组成部分——偏差得分差异(BAD,基于CEAT、I-WEAT、I-SEAT)、人格灵敏度指数(PSI)和波动性(标准差),并通过LIME方法分析增强可解释性。本研究分为两个不同任务进行。任务1建立静态偏见基线,任务2应用六种人格框架(边缘化和结构性特权)以衡量BADx、PSI和波动性。该研究覆盖五个最先进的LLM(GPT-4o、DeepSeek-R1、LLaMA-4、Claude 4.0 Sonnet和Gemma-3n E4B)。结果表明,人格情境显著调制偏见。GPT-4o表现出高灵敏度和波动性;DeepSeek-R1抑制偏见但波动性不稳定;LLaMA-4保持低波动性和稳定的偏见轮廓,放大幅度有限;Claude 4.0 Sonnet实现平衡调制;Gemma-3n E4B实现最低波动性,呈中度放大。BADx优于静态方法,揭示静态方法忽略的情境敏感性偏见。我们的统一方法为检测五个流行LLM中的动态隐性交叉性偏见提供了系统方法。
引用
@article{arxiv.2604.06213,
title = {Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models},
author = {Nandini Arimanda and Achyuth Mukund and Sakthi Balan Muthiah and Rajesh Sharma},
journal= {arXiv preprint arXiv:2604.06213},
year = {2026}
}
备注
11 pages, 5 figures, ACM WebScience Conference, 6 Tables