中文

控制你的共享内容:评估语言模型对隐私偏好的遵循

计算与语言 2025-10-21 v2 人工智能

摘要

大型语言模型(LLM)主要通过商业 API 访问,但这通常要求用户将其数据暴露给服务提供商。在本文中,我们探讨用户如何通过使用隐私配置文件来保持对数据的控制:这是一种简单的自然语言指令,规定了哪些内容应该或不应该被透露。我们构建了一个框架,其中本地模型使用这些指令来重写查询,仅隐藏用户视为敏感的细节,然后再将其发送给外部模型,从而在隐私与性能之间取得平衡。为支持这项研究,我们引入了 PEEP,这是一个包含真实用户查询的多语言数据集,标注了隐私内容,并配有人工合成的隐私配置文件。使用轻量级本地 LLM 的实验表明,在微调之后,它们不仅实现了显著更好的隐私保护,而且匹配或超越了更大型的零样本模型的性能。同时,该系统在完全遵循用户指令方面仍面临挑战,凸显了需要能够更好理解用户自定义隐私偏好的模型。

关键词

引用

@article{arxiv.2507.05391,
  title  = {Controlling What You Share: Assessing Language Model Adherence to Privacy Preferences},
  author = {Guillem Ramírez and Alexandra Birch and Ivan Titov},
  journal= {arXiv preprint arXiv:2507.05391},
  year   = {2025}
}