中文

隐私清单:基于语境完整性理论的隐私违规检测

计算与语言 2025-02-14 v2 密码学与安全

摘要

隐私研究已引起广泛关注,因为人们担心其私人数据在与智能设备、社交平台和AI应用交互时可能被轻易泄露。另一方面,计算机科学研究人员通常通过针对特定领域的隐私攻击与防御来研究隐私问题。隐私研究在多个子领域进行,包括计算机视觉(CV)、自然语言处理(NLP)和计算机网络。在每个领域内,隐私有其自身的表述。尽管关于攻击与防御的开创性工作揭示了敏感的隐私问题,但它们范围狭窄,无法全面覆盖人们实际的隐私关切。因此,通用且以人为中心的隐私研究仍然探索不足。在本文中,我们将隐私问题表述为一个推理问题,而非简单的模式匹配。我们以语境完整性(CI)理论为基础,该理论认为人们对隐私的感知与相应的社会语境高度相关。基于这一假设,我们开发了首个全面的清单,涵盖社会身份、私人属性和现有隐私法规。与先前仅覆盖有限专家标注规范或建模不完整社会语境的CI研究不同,我们提出的隐私清单以1996年《健康保险可携性与责任法案》(HIPAA)为例,展示了我们可以借助大语言模型(LLMs)全面覆盖HIPAA的规定。此外,我们的清单还汇集了多个本体论的专家标注,以确定私人信息,包括但不限于个人身份信息(PII)。我们关于HIPAA的初步结果为未来以语境为中心的隐私研究提供了启示,以覆盖更多的隐私法规、社会规范和标准。

关键词

引用

@article{arxiv.2408.10053,
  title  = {Privacy Checklist: Privacy Violation Detection Grounding on Contextual Integrity Theory},
  author = {Haoran Li and Wei Fan and Yulin Chen and Jiayang Cheng and Tianshu Chu and Xuebing Zhou and Peizhao Hu and Yangqiu Song},
  journal= {arXiv preprint arXiv:2408.10053},
  year   = {2025}
}

备注

To appear at NAACL 25