中文

LLM 的道德灵敏性:通过行为轮廓和机制解释性进行的分层偏见评估

机器学习 2026-05-06 v1 计算机与社会

摘要

大语言模型 (LLM) 越来越被部署在需要细致伦理推理的场景中,但现有的偏见评估将模型输出简单地视为“有偏见”或“无偏见”。这种二进制框架忽略了偏见实际出现的渐进、情境依赖的方式。我们通过两个阶段来弥补这一差距:行为轮廓和机制验证。在行为阶段,我们引入道德灵敏度指数 (MSI),衡量模型在从抽象数值问题到根植于历史和社会经济不公的情境的七层梯度测试中产生偏见输出概率。评估四个领先模型 (Claude 3.5、Qwen 3.5、Llama 3 和 Gemini 1.5),我们识别出由对齐设计形成的 distinct 行为特征:例如,Gemini 1.5 在社会经济框架下第 5 层达到 72.7% 的 MSI,而 Claude 表现出与身份基于安全训练一致的尖锐抑制。我们随后对这些行为模式进行机械验证。我们选取产生最高 MSI 得分的犯罪偏见情境作为探针,对控制组六个模型进行分析,这些模型跨越三个能力层级:小语言模型 (SLM)、指令调优基础模型和推理蒸馏变体。电路水平分析揭示了偏见的 U 型曲线:SLM 表现出强烈的犯罪偏见;通过规模化到指令调优模型可消除该偏见;推理蒸馏重新引入偏见,使其恢复到与相同参数计数的 SLM 水平,表明蒸馏压缩推理痕迹的方式会重新激活浅层统计关联。关键的是,驱动高 MSI 得分的社会负载线索在机械上识别出相同的偏见驱动电路,提供了跨阶段的验证。

关键词

引用

@article{arxiv.2605.03217,
  title  = {Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability},
  author = {Yash Aggarwal and Atmika Gorti and Vinija Jain and Aman Chadha and Krishnaprasad Thirunarayan and Manas Gaur},
  journal= {arXiv preprint arXiv:2605.03217},
  year   = {2026}
}