在潜在空间中发现偏见:一种无监督去偏方法
机器学习
2024-06-07 v1
摘要
基础模型的问答(QA)能力对提示变化高度敏感,使其性能容易受到表面、非意义改变的影响。这种脆弱性通常源于模型对特定输入特征的偏好或偏见,例如选项位置或多模态设置中的表面图像特征。我们提出直接在模型的内部表示中纠正这种偏见。我们的方法SteerFair在模型的表示空间中找到偏见方向,并在推理期间将激活值远离该方向。具体来说,我们利用了偏见通常遵循简单关联规则这一观察,例如第一个选项与正确可能性之间的虚假关联。接下来,我们从无标签样本中构建这些规则的演示,并使用它们来识别偏见方向。我们通过实验证明,SteerFair在三个基准任务上显著降低了指令调优模型在提示修改下的性能方差。值得注意的是,我们的方法在平均准确率上比使用100个标签的监督基线高出10.86个百分点,在得分上高出12.95分,并且与使用500个标签的性能相匹配。
引用
@article{arxiv.2406.03631,
title = {Discovering Bias in Latent Space: An Unsupervised Debiasing Approach},
author = {Dyah Adila and Shuai Zhang and Boran Han and Yuyang Wang},
journal= {arXiv preprint arXiv:2406.03631},
year = {2024}
}