一种用于文本异常检测的鲁棒自编码器集成方法
计算与语言
2024-09-19 v2 机器学习
摘要
异常检测(AD)是视觉和时间序列等成熟应用中一个快速增长且受欢迎的领域。我们观察到这些应用拥有丰富的文献,但文本中的异常检测才刚刚起步。最近,带有自注意力机制的自监督方法一直是最受欢迎的选择。虽然近期的工作为构建和对齐最先进方法奠定了基础,但我们在本文中提出了两项主要贡献:上下文异常污染和一种新颖的基于集成的方法。我们的方法 Textual Anomaly Contamination (TAC) 允许用独立异常或上下文异常污染内点类。在现有文献中,似乎并未进行这种区分。为了寻找上下文异常,我们提出了 RoSAE,一种鲁棒子空间局部恢复自编码器集成。该集成中的所有自编码器通过局部流形学习呈现出不同的潜在表示。基准测试表明,我们的方法在独立异常和上下文异常上均优于近期工作,同时具有更强的鲁棒性。我们还提供了 8 个数据集的比较,而不仅仅依赖于 Reuters 和 20 Newsgroups 语料库。
引用
@article{arxiv.2405.13031,
title = {A Robust Autoencoder Ensemble-Based Approach for Anomaly Detection in Text},
author = {Jeremie Pantin and Christophe Marsala},
journal= {arXiv preprint arXiv:2405.13031},
year = {2024}
}