基于多视图语言表示的文本异常检测
计算与语言
2026-01-27 v1 机器学习
摘要
文本异常检测 (TAD) 在各种语言驱动的实际应用中发挥关键作用,包括有害内容 moderation、钓鱼检测和垃圾评论过滤。虽然两步“嵌入-检测器”TAD方法显示出领先性能,但常受限于单一嵌入模型的使用以及缺乏适应不同数据集和异常类型的灵活性。为解决这些限制,我们提出利用来自多个预训练语言模型的嵌入,并将其集成到 的多视图TAD框架中。采用多视图重建模型有效地从多个嵌入视角中提取正常文本模式。为利用视图之间的互补性,设计了对比协作模块以利用并强化不同视图之间的相互作用。此外,开发了自适应分配模块,用于自动分配每个视图的贡献权重,从而提高对不同数据集的适应性。针对10个基准数据集进行大量实验验证了在强基线上的有效性。的源代码已公开于 https://github.com/yankehan/MCA2。
引用
@article{arxiv.2601.17786,
title = {Beyond a Single Perspective: Text Anomaly Detection with Multi-View Language Representations},
author = {Yixin Liu and Kehan Yan and Shiyuan Li and Qingfeng Chen and Shirui Pan},
journal= {arXiv preprint arXiv:2601.17786},
year = {2026}
}
备注
17 pages, 7 tables, and 5 figures