数据稀缺下隐私政策信息抽取的人机协同方法
计算机与社会
2023-06-01 v2 人工智能
摘要
隐私政策的机器可读表示是多种新型隐私增强技术,特别是透明度增强技术(TETs)的敲门砖。为生成此类表示,需要从书面隐私政策中抽取透明度信息。然而,相应的手动标注与抽取过程繁琐且需要专家知识。反之,由于隐私政策这一特定领域过高的错误率,全自动化标注方法迄今未能成功。最终, properly 标注的隐私政策及相应机器可读表示的缺乏持续存在,并长久阻碍了促进政策感知与数据主体知情性的新技术方法的开发与建立。在本文中,我们提出了一个用于隐私政策标注的“人在回路”(Human-in-the-Loop)原型系统,该系统集成了 ML 生成的建议并最终由人类作出标注决策。我们提出了一种基于 ML 的建议系统,专为隐私政策标注领域普遍存在的数据稀缺约束而定制。在此基础上,我们向用户提供有意义的预测,从而简化标注流程。此外,我们还通过原型实现评估了我们的方法,表明我们的基于 ML 的抽取方法优于其他近期用于法律文档的抽取模型。
引用
@article{arxiv.2305.15006,
title = {A Human-in-the-Loop Approach for Information Extraction from Privacy Policies under Data Scarcity},
author = {Michael Gebauer and Faraz Maschhur and Nicola Leschke and Elias Grünewald and Frank Pallas},
journal= {arXiv preprint arXiv:2305.15006},
year = {2023}
}
备注
Accepted for 2023 IEEE European Symposium on Security and Privacy Workshops (EuroS&P)