共享还是不共享:普通用户愿为差分隐私 NLP 系统承担何种敏感数据风险?
计算与语言
2024-03-26 v2 密码学与安全
摘要
尽管 NLP 社区已将中心化差分隐私作为隐私保护模型训练或数据共享的常用框架,但关键参数——控制隐私保护强度的隐私预算 ——的选择与解释在很大程度上仍是任意的。我们认为, 值的确定不应仅由研究人员或系统开发者掌控,还必须考虑实际共享其潜在敏感数据的用户。换言之:你会为 而分享你的即时消息吗?我们通过设计、实施并开展一项行为实验(311 名普通参与者)来弥补这一研究空白,以研究人们在面临隐私威胁情境下不确定性决策中的行为。以两个真实 NLP 场景构建风险感知框架,并采用 vignette 行为研究,有助于我们确定何种 阈值会使普通用户愿意共享敏感文本数据——据我们所知,这是此类首项研究。
引用
@article{arxiv.2307.06708,
title = {To share or not to share: What risks would laypeople accept to give sensitive data to differentially-private NLP systems?},
author = {Christopher Weiss and Frauke Kreuter and Ivan Habernal},
journal= {arXiv preprint arXiv:2307.06708},
year = {2024}
}
备注
Accepted at LREC-COLING 2024; final camera-ready version