模型编辑在社交去偏中的潜力与挑战
计算与语言
2024-02-22 v1 人工智能
摘要
大规模语言模型 (LLM) 训练于广泛语料库,必然包含刻板印象偏见。通过微调来缓解这些偏见可能既昂贵又数据稀缺。模型编辑方法专注于事后修改 LLM,具有巨大的去偏潜力。然而,缺乏对促进内部和外部模型编辑方法、支持各种偏见类型,以及理解将编辑方法应用于刻板去偏的优缺点的全面研究。为弥合这一差距,我们仔细将社交去偏形式化为编辑问题,对七种现有模型编辑算法进行刻板去偏(即去偏编辑)基准测试。我们在三个场景中发现了刻板去偏的潜力与挑战:(1) 现有模型编辑方法能够有效保留知识并缓解偏见,但从编辑句子到语义等价句子的去偏效果泛化性有限。(2) 顺序编辑凸显了 SERAC(Mitchell 等 2022b)的鲁棒性,而内部编辑方法会随编辑次数的增加而退化。(3) 模型编辑算法在同一类型和不同类型的未见偏见上实现了泛化。在这些发现基础上,我们进一步提出两种简单且有效的方法来改进去偏编辑,并实验表明所提方法有效。
引用
@article{arxiv.2402.13462,
title = {Potential and Challenges of Model Editing for Social Debiasing},
author = {Jianhao Yan and Futing Wang and Yafu Li and Yue Zhang},
journal= {arXiv preprint arXiv:2402.13462},
year = {2024}
}
备注
Work in progress