通过逻辑网格拼图评估 LLM 推理中的隐性偏见
人工智能
2025-11-11 v1 计算与语言
计算机与社会
摘要
尽管近期的安全护栏有效地抑制了明显带有偏见的输出,但在复杂的逻辑推理任务中会出现更微妙的社会偏见形式,这些偏见逃避了当前的评估基准。为了填补这一空白,我们引入了一个新的评估框架 PRIME(模型评估中隐性偏见的拼图推理),该框架使用逻辑网格拼图系统地探究社会刻板印象对 LLM 中逻辑推理和决策的影响。我们对逻辑拼图的使用实现了自动生成和验证,以及在复杂度和偏见设置上的可变性。PRIME 包含由共享拼图结构生成的刻板印象、反刻板印象和中立拼图变体,从而实现可控且细粒度的比较。我们跨拼图规模评估了多个模型家族,并测试了基于提示的缓解策略的有效性。我们将实验重点放在性别刻板印象上,研究结果表明,当解决方案与刻板印象关联一致时,模型推理始终更准确。这证明了 PRIME 对于诊断和量化 LLM 演绎推理中固有的社会偏见具有重要意义,而在这些推理中公平性至关重要。
引用
@article{arxiv.2511.06160,
title = {Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles},
author = {Fatima Jahara and Mark Dredze and Sharon Levy},
journal= {arXiv preprint arXiv:2511.06160},
year = {2025}
}
备注
24 pages (including appendix)