用于单类文本异常检测的自监督损失
计算与语言
2022-04-13 v1
摘要
当前用于文本异常检测的深度学习方法依赖于正常样本中的监督信号,而这些信号可能难以获取,或依赖于难以调优的定制架构。我们研究了一种更简单的替代方案:以自监督目标在正常样本数据上微调 Transformer,并将损失用作异常分数。总体而言,在各种异常检测场景下,自监督方法优于其他方法,在语义异常上的 AUROC 分数平均提升 11.6%,在句法异常上平均提升 22.8%。此外,最优目标及由此学习到的表示取决于下游异常的类型。异常与正常样本的可分离性表明该表示更适用于检测语义异常,而窄特征方向的存在表明该表示适用于检测句法异常。
引用
@article{arxiv.2204.05695,
title = {Self-Supervised Losses for One-Class Textual Anomaly Detection},
author = {Kimberly T. Mai and Toby Davies and Lewis D. Griffin},
journal= {arXiv preprint arXiv:2204.05695},
year = {2022}
}