预训练 Transformer 能否用于检测复杂敏感句子?——以孟山都案为例
计算与语言
2022-03-15 v1
摘要
每个组织都会以多种形式发布信息,从年度报告到法律诉讼文件不一而足。此类文档可能包含敏感信息,公开发布可能导致机密信息泄露。检测文档中含有敏感信息的句子可帮助组织防止宝贵机密信息的泄漏。当此类句子包含大量信息或为已知敏感内容的改写版本时,这一任务尤其具有挑战性。当前在此类复杂场景下用于敏感信息检测的方法基于关键词方法或标准机器学习模型。在本文中,我们希望探究预训练 transformer 模型是否非常适合检测复杂敏感信息。预训练 transformer 通常在海量文本上训练,因此易于学习语法、结构及其他语言特征,使其对该任务尤为具有吸引力。通过在孟山都审判数据集上的实验,我们观察到微调后的双向编码器表示来自 Transformer (BERT) transformer 模型优于传统模型。我们在孟山都数据集的四类不同文档上进行了实验,观察到相较于现有敏感信息检测模型,BERT 在 GHOST 上的 F2 分数提升了 24.13% 至 65.79%,在 TOXIC 上提升了 30.14% 至 54.88%,在 CHEMI 上提升了 39.22%,在 REGUL 上提升了 53.57%。
引用
@article{arxiv.2203.06793,
title = {Can pre-trained Transformers be used in detecting complex sensitive sentences? -- A Monsanto case study},
author = {Roelien C. Timmer and David Liebowitz and Surya Nepal and Salil S. Kanhere},
journal= {arXiv preprint arXiv:2203.06793},
year = {2022}
}