内部的拉锯战:缓解大型语言模型中的公平性与隐私性冲突
人工智能
2025-06-04 v2
摘要
确保大型语言模型(LLM)对公平性和隐私性的认知至关重要。有趣的是,我们发现了一种反直觉的权衡现象:通过监督微调(SFT)方法增强LLM的隐私意识,会显著降低其公平意识,且仅需数千个样本。为解决此问题,受信息论启发,我们引入了一种无需训练的方法——抑制隐私与公平耦合神经元(SPIN),该方法在理论和实验上均能降低公平性与隐私意识之间的互信息。大量实验结果表明,SPIN消除了权衡现象,并在不损害通用能力的情况下,同时显著提升了LLM的公平意识和隐私意识,例如,使Qwen-2-7B-Instruct的公平意识提升12.2%,隐私意识提升14.0%。更为关键的是,SPIN在标注数据有限甚至仅存在恶意微调数据时仍保持稳健有效,而SFT方法在此类场景下可能无法正常运行。此外,我们展示了SPIN可推广至其他潜在的权衡维度。我们希望这项研究能为同时解决LLM中的公平性和隐私性问题提供有价值的见解,并能被整合到综合框架中,以开发更合乎伦理和负责任的AI系统。我们的代码可在https://github.com/ChnQ/SPIN获取。
引用
@article{arxiv.2410.16672,
title = {The Tug of War Within: Mitigating the Fairness-Privacy Conflicts in Large Language Models},
author = {Chen Qian and Dongrui Liu and Jie Zhang and Yong Liu and Jing Shao},
journal= {arXiv preprint arXiv:2410.16672},
year = {2025}
}
备注
ACL 2025 Main Conference