超越文本:通过句法分析与语义角色标注解析隐私声明
计算与语言
2020-10-05 v1 计算机与社会
摘要
本文基于情境完整性(Contextual Integrity)这一成熟的隐私规范推理社会理论框架,提出了从隐私政策中提取隐私参数的新任务。由律师撰写的隐私政策篇幅冗长,且常包含不完整与模糊的陈述。本文表明,传统的自然语言处理(NLP)任务,包括近期提出的基于问答(Question-Answering)的解决方案,不足以解决隐私参数提取问题,其精确率与召回率均较低。我们描述了四类可部分适配以应对该参数提取任务且成效不一的传统方法:隐马尔可夫模型(Hidden Markov Models)、微调的 BERT 模型、依存类型解析(Dependency Type Parsing, DP)与语义角色标注(Semantic Role Labeling, SRL)。基于对 36 份大型企业真实隐私政策的详细评估,我们证明结合句法 DP 与特定类型 SRL 任务的方案在从隐私声明中检索情境隐私参数时具有最高准确率。我们还观察到,引入领域特定知识对实现高精确率与召回率至关重要,从而启发了针对隐私领域这一重要问题的新 NLP 研究。
引用
@article{arxiv.2010.00678,
title = {Beyond The Text: Analysis of Privacy Statements through Syntactic and Semantic Role Labeling},
author = {Yan Shvartzshnaider and Ananth Balashankar and Vikas Patidar and Thomas Wies and Lakshminarayanan Subramanian},
journal= {arXiv preprint arXiv:2010.00678},
year = {2020}
}
备注
11 pages, 4 figures