我们需要多少用户上下文?心理健康 NLP 应用中的隐私设计
计算与语言
2022-09-07 v1 密码学与安全
摘要
临床 NLP 任务,例如基于文本的心理健康评估,必须考虑社会约束——性能最大化必须以保障用户数据隐私的极端重要性为约束。消费者保护法规,如 GDPR,通常通过限制数据可用性来处理隐私,例如要求将用户数据限制为给定目的“所必需”的范围。在这项工作中,我们论证了在大多数情况下,提供更严格的形式化隐私保证,同时增加模型中的用户数据量,会为所有相关方(尤其是用户)带来更大收益。我们在两个现有的 Twitter 和 Reddit 帖子自杀风险评估数据集上展示了我们的论点。我们首次提出了将用户历史长度与差分隐私预算并列的分析,并阐述了建模额外用户上下文如何在维持可接受的用户隐私保证的同时实现效用的保持。
引用
@article{arxiv.2209.02022,
title = {How Much User Context Do We Need? Privacy by Design in Mental Health NLP Application},
author = {Ramit Sawhney and Atula Tejaswi Neerkaje and Ivan Habernal and Lucie Flek},
journal= {arXiv preprint arXiv:2209.02022},
year = {2022}
}
备注
Accepted to ICWSM 2023