中文

基于特征空间相似性搜索的异常检测决策边界细化

机器学习 2026-02-04 v1 人工智能 密码学与安全 神经与进化计算

摘要

检测高度不平衡数据集中的稀有且多样化异常——例如网络安全中的高级持续性威胁 (APTs)——是机器学习系统的根本挑战。主动学习是一个可行的方向,通过战略性地查询 oracle 来最小化标注成本,但常规方法往往未充分利用特征空间的内在几何结构进行模型细化。本文引入 SDA2E (Sparse Dual Adversarial Attention-based AutoEncoder),用于从不平衡的高维数据中学习紧凑且判别性的潜表征。我们进一步提出一种基于相似性的主动学习框架,集成三种新策略高效细化决策边界:正态-like 扩展,通过 enrichment 类似标记正常点的训练集以提高重建保真度;异常-like 优先级,通过聚焦于类似既有异常的点来提升排序准确度;以及混合策略,实现平衡的模型细化和排序。我们框架的关键组件是针对稀疏二进制嵌入的新型相似性度量 Normalized Matching 1s (SIM_NM1)。我们在 52 个不平衡数据集上广泛评估了 SDA2E,包括多个 DARPA Transparent Computing 场景,并将其与 15 种最新异常检测方法进行基准测试。结果表明,SDA2E 在多个案例中实现了一致的优异排序性能 (nDCG 最高达 1.0),同时将被动训练所需的标注数据减少最高可达 80%。统计检验确认这些改进的显著性。我们的工作建立了一个针对网络安全等场景(如 APT 检测)特别合适的稳健、高效且在统计上得到验证的异常检测框架。

关键词

引用

@article{arxiv.2602.02925,
  title  = {Refining Decision Boundaries In Anomaly Detection Using Similarity Search Within the Feature Space},
  author = {Sidahmed Benabderrahmane and Petko Valtchev and James Cheney and Talal Rahwan},
  journal= {arXiv preprint arXiv:2602.02925},
  year   = {2026}
}