中文

DATE:基于Transformer自监督的文本异常检测

计算与语言 2021-04-13 v1

摘要

近年来,利用深度学习模型进行异常检测(AD)因优于传统方法而得到广泛应用。近期针对图像异常的深度方法在以端到端自监督设定学习正态性特征方面表现更佳。这些方法训练一个模型来判别应用于视觉数据的不同变换,然后利用输出计算异常分数。我们将该方法用于文本中的AD,通过对文本序列引入新颖的预训练任务。我们端到端地学习DATE模型,施加两个独立且互补的自监督信号,一个在词元级,一个在序列级。在这一新任务设定下,我们在20Newsgroups和AG News数据集上展示了强劲的定量与定性结果。在半监督设定下,我们分别以+13.5%和+6.9%(AUROC)优于state-of-the-art结果。在无监督配置下,DATE即使在其10%的训练数据被异常值污染时(其他模型为0%)也超越所有其他方法。

关键词

引用

@article{arxiv.2104.05591,
  title  = {DATE: Detecting Anomalies in Text via Self-Supervision of Transformers},
  author = {Andrei Manolache and Florin Brad and Elena Burceanu},
  journal= {arXiv preprint arXiv:2104.05591},
  year   = {2021}
}

备注

conference paper at NAACL-HLT 2021, 11 pages, 6 figures, 3 tables