AMBEDKAR:通过知识增强的解码方法实现多层级偏见消除,以实现语言模型的鲁棒宪法对齐
计算与语言
2025-09-03 v1
摘要
大语言模型(LLM)可能会无意中反映其训练数据中存在的社会偏见,导致有害或带有偏见的输出。在印度语境下,我们对一系列模型的实证评估表明,种姓与宗教方面的偏见尤为突出。然而,大多数现有的缓解策略以西方为中心,未能解决这些局部细微差异。我们提出了 AMBEDKAR,一个受印度宪法缔造者 B. R. Ambedkar 博士的平等主义愿景启发的框架,旨在引导 LLM 输出走向符合第 14 至 17 条的公平、中立与包容。我们的方法引入了宪法感知解码层,受印度 AI 宪法指导且仅在推理时应用,不对基础模型进行任何参数更新。我们引入了一种推测解码算法,在生成过程中主动减少种姓主义与社群偏见。该缓解层直接在解码过程中运行,避免了对模型内部的修改,并降低了与重新训练相关的计算与基础设施成本。我们将推测解码重新解释不仅作为效率工具,而是作为实现公平的机制。在此框架中,小语言模型(SLM)充当可能有偏见的生成器,而受宪法指导的大语言模型(LLM)充当验证器。LLM 并非加速生成,而是强制 SLM 输出中的抗偏见轨迹。这种角色的反转产生了一种“通过推测实现公平”的范式。与基线相比,我们的方法实现了高达 26.41% 的偏见绝对减少。我们的源代码、数据集与结果可在 https://anonymous.4open.science/r/AMBEDKAR-983B/ 获取。
引用
@article{arxiv.2509.02133,
title = {AMBEDKAR-A Multi-level Bias Elimination through a Decoding Approach with Knowledge Augmentation for Robust Constitutional Alignment of Language Models},
author = {Snehasis Mukhopadhyay and Aryan Kasat and Shivam Dubey and Rahul Karthikeyan and Dhruv Sood and Vinija Jain and Aman Chadha and Amitava Das},
journal= {arXiv preprint arXiv:2509.02133},
year = {2025}
}