你的模型敏感吗?SPeDaC:一种用于检测与分类敏感个人数据的新基准
计算与语言
2023-02-09 v3 人工智能
摘要
近年来,包括对话系统在内的处理敏感个人信息的应用呈指数级增长。这使得虚拟环境中个人数据保护这一极其重要的问题凸显出来。敏感信息检测(SID)在文献中涉及不同领域与语言。然而,若具体到个人数据领域,缺乏共享基准或可用的标注资源使得与当前最优(SOTA)方法的比较十分困难。我们提出并发布了 SPeDaC,一种用于识别英语中敏感个人数据类别的新标注资源。SPeDaC 支持对计算模型在三个复杂度递增的 SID 子任务上进行评估。SPeDaC 1 涉及二分类,模型需检测句子是否包含敏感信息;而在 SPeDaC 2 中,我们使用与个人信息宏观领域相关的 5 个类别收集标注句子;在 SPeDaC 3 中,标注为细粒度(61 个个人数据类别)。我们使用多种当前最优分类器对该资源进行了广泛评估。结果表明 SPeDaC 具有挑战性,尤其在细粒度分类方面。Transformer 模型取得了最佳结果(SPeDaC 1 上 RoBERTa 准确率 = 98.20%,SPeDaC 2 上 DeBERTa = 95.81%,SPeDaC 3 上 = 77.63%)。
引用
@article{arxiv.2208.06216,
title = {Is Your Model Sensitive? SPeDaC: A New Benchmark for Detecting and Classifying Sensitive Personal Data},
author = {Gaia Gambarelli and Aldo Gangemi and Rocco Tripodi},
journal= {arXiv preprint arXiv:2208.06216},
year = {2023}
}
备注
25 pages, 4 figures, 12 tables