中文

PrivacyLens:评估语言模型在实际场景中的隐私规范意识

计算与语言 2025-03-17 v3 人工智能 密码学与安全

摘要

随着语言模型(LM)在个性化通信场景(如发送邮件、撰写社交媒体帖子)中广泛应用,并具备一定的自主性,确保其在特定情境下遵循隐私规范变得日益关键。然而,衡量LM的隐私规范意识水平及其在LM中介通信中潜在的隐私风险,面临两个挑战:(1)隐私敏感案例具有情境依赖性和长尾分布特性;(2)缺乏能够捕捉真实应用情境的评估方法。为此,我们提出了PrivacyLens——一个新型框架,通过将隐私敏感种子扩展为生动场景,再进一步扩展为agent轨迹,从而实现对LM代理行为中隐私泄露的多层次评估。我们基于隐私文献中的隐私规范及众包种子构建了PrivacyLens数据集。使用该数据集,我们发现LM在解答探测性问题的表现与其在执行用户指令时实际行为之间存在差距。诸如 GPT-4 和 Llama-3-70B 等最新语言模型,即使在包含隐私增强指令的情况下,在 25.68% 和 38.69% 的情况下也会泄露敏感信息。我们还通过将每个种子扩展为多个轨迹,展示了PrivacyLens的动态特性,用于红队测试LM的隐私泄露风险。数据集和代码已发布于 https://github.com/SALT-NLP/PrivacyLens。

关键词

引用

@article{arxiv.2409.00138,
  title  = {PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action},
  author = {Yijia Shao and Tianshi Li and Weiyan Shi and Yanchen Liu and Diyi Yang},
  journal= {arXiv preprint arXiv:2409.00138},
  year   = {2025}
}

备注

NeurIPS 2024 Datasets and Benchmarks Track