中文

通过偏置神经元消除缓解指令跟随语言模型的偏差

人工智能 2024-06-06 v2 计算与语言 机器学习

摘要

指令跟随语言模型常表现出不良偏差。这些不良偏差在语言模型的实际使用中可能被放大,其中通过零样本示例提示使用了广泛的指令。为解决该问题,我们首先定义了显著影响其偏置输出的偏置神经元,并经验性地证明其存在。此外,我们提出一种新颖且实用的偏差缓解方法 CRISPR,用于在指令跟随设定下消除语言模型的偏置神经元。CRISPR 自动判定偏置输出,并利用可解释性方法将影响偏置输出的神经元归类为偏置神经元。实验结果表明,我们的方法在零样本指令跟随设定下缓解偏差的有效性,且不损失模型任务性能与已有知识。实验结果揭示了方法的泛化能力,因其在各类指令与数据集下均表现出鲁棒性。令人惊讶的是,我们的方法仅通过消除极少数神经元(至少三个)即可缓解语言模型中的偏差。

关键词

引用

@article{arxiv.2311.09627,
  title  = {Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination},
  author = {Nakyeong Yang and Taegwan Kang and Jungkyu Choi and Honglak Lee and Kyomin Jung},
  journal= {arXiv preprint arXiv:2311.09627},
  year   = {2024}
}

备注

accepted to ACL 2024