中文

语言模型中的隐私偏差:基于情境完整性的审计指标

机器学习 2025-12-22 v3 人工智能 密码学与安全 计算机与社会

摘要

随着大型语言模型(LLM)被集成到社会技术系统中,审查其所呈现的隐私偏差至关重要。我们将隐私偏差定义为LLM响应中信息流的恰当价值。隐私偏差与预期值之间的偏差,可能指示隐私违规。作为审计指标,隐私偏差有助于(1)模型训练者评估LLM的伦理和社会影响,(2)服务提供者选择符合情境要求的LLM,以及(3)政策制定者评估部署LLM中隐私偏差的恰当性。我们提出了一个新的研究问题:如何可靠地审查LLM中的隐私偏差及其影响因素?我们提出了一种新方法,用于评估LLM中的隐私偏差,采用基于情境完整性的方法来评估来自各种LLM的响应。我们的方案考虑了响应在提示变更下的灵敏度,这会阻碍隐私偏差的评估。最后,我们研究了隐私偏差如何受到模型容量和优化的影响。

关键词

引用

@article{arxiv.2409.03735,
  title  = {Privacy Bias in Language Models: A Contextual Integrity-based Auditing Metric},
  author = {Yan Shvartzshnaider and Vasisht Duddu},
  journal= {arXiv preprint arXiv:2409.03735},
  year   = {2025}
}

备注

Privacy Enhancing Technologies Symposium (PETS), 2026