PBa-LLM:基于命名实体识别(NER)的隐私与偏见感知自然语言处理
计算与语言
2025-07-10 v2 人工智能
密码学与安全
机器学习
摘要
尽管大型语言模型(Large Language Models, LLMs)在近年间尤其自从出现后在高风险AI应用中表现突出,但其强大的性能伴随重要的法律/伦理关切,尤其涉及隐私、数据保护和透明度。鉴于这些关切,本文探索了使用命名实体识别(Named-Entity Recognition, NER)来促进大语言模型的隐私保留训练(或适应)。我们提出一种框架,使用NER技术对文本数据中的敏感信息(如个人身份或地理位置)进行匿名化处理。对 proposed 隐私保留学习框架的评估旨在衡量其对用户隐私和系统性能在特定高风险敏感场景——基于AI的招聘流程简历评分——中的影响。该研究涉及两种语言模型(BERT和RoBERTa)和六种基于Presidio、FLAIR、BERT及不同GPT版本的匿名化算法,适用于2.4万名候选人档案。研究结果表明,所提出的隐私保留技术有效维持了系统性能,同时在保护候选人保密方面发挥关键作用,从而促进了实验场景中的信任。除所提出的隐私保留方法外,我们还实验应用一种现有方法以减少大语言模型中的性别偏见,最终获得我们提出的隐私与偏见感知大语言模型(Privacy- and Bias-aware LLMs, PBa-LLMs)。值得注意的是,所提出的PBa-LLMs在特定场景(简历评分)中进行了评估,但可普遍应用于其他任何基于LLM的AI应用。
关键词
引用
@article{arxiv.2507.02966,
title = {PBa-LLM: Privacy- and Bias-aware NLP using Named-Entity Recognition (NER)},
author = {Gonzalo Mancera and Aythami Morales and Julian Fierrez and Ruben Tolosana and Alejandro Penna and Miguel Lopez-Duran and Francisco Jurado and Alvaro Ortigosa},
journal= {arXiv preprint arXiv:2507.02966},
year = {2025}
}
备注
Presented at AAAI Workshop on Privacy-Preserving Artificial Intelligence (PPAI) 2025, Philadelphia, PA, USA, March 2025