从知识编辑视角消除大语言模型偏见
计算与语言
2024-07-02 v2 人工智能
摘要
现有的减偏方法不可避免地会产生不合理或不希望的预测,因为它们旨在实现不同社会群体之间的平等,却忽视了个别事实,导致修改现有知识。在本文中,我们首先构建了一个新的减偏基准 BiasKE,利用现有和额外构建的数据集,通过公平性、特异性和泛化性的互补指标系统性评估减偏性能。同时,我们提出了一种新型减偏方法 Fairness Stamp(FAST),通过对个别有偏知识进行精细校准实现可编辑的公平性。全面实验表明,FAST 在保持模型整体知识保留能力的同时,超过了最新方法,实现卓越的减偏性能,凸显了针对可编辑公平性在大语言模型中进行精细减偏策略的前景。
引用
@article{arxiv.2405.09341,
title = {Large Language Model Bias Mitigation from the Perspective of Knowledge Editing},
author = {Ruizhe Chen and Yichen Li and Zikai Xiao and Zuozhu Liu},
journal= {arXiv preprint arXiv:2405.09341},
year = {2024}
}