中文

BiasGym:一个通过诱导进行偏差分析与消除的简单且可泛化的框架

计算与语言 2026-02-03 v4 人工智能 机器学习

摘要

理解编码在大型语言模型(LLM)权重中的偏差与刻板印象,对于制定有效的缓解策略至关重要。然而,偏差行为通常是微妙的,即使刻意诱导也难以分离,这使得系统性的分析和去偏变得尤为困难。为了解决这个问题,我们引入了 BiasGym,这是一个简单、低成本且可泛化的框架,用于可靠且安全地在 LLM 中注入、分析和缓解偏差的概念关联。BiasGym 包含两个组件:BiasInject,通过基于 token 的微调在保持模型冻结的状态下安全地注入特定偏差;以及 BiasScope,利用这些注入的信号来识别并可靠地引导负责偏差行为的组件。我们的方法能够实现一致的偏差诱导以进行机制分析,支持有针对性的去偏而不降低下游任务的性能,并能泛化到微调期间未见过的偏差。我们展示了 BiasGym 在减少现实世界刻板印象(例如,来自意大利的人是“鲁莽的司机”)方面的有效性,显示了其在安全干预和可解释性研究中的实用性。

关键词

引用

@article{arxiv.2508.08855,
  title  = {BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Elicitation},
  author = {Sekh Mainul Islam and Nadav Borenstein and Siddhesh Milind Pawar and Haeun Yu and Arnav Arora and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2508.08855},
  year   = {2026}
}

备注

Under review. Title updated