中文

针对模拟高度不平衡工业分类问题的异常检测器评估

人工智能 2026-02-16 v2 计算与语言 机器学习

摘要

机器学习为质量控制和预测性维护等领域的当前问题提供了潜在解决方案,但也面临着工业应用中的独特障碍。其中一个持续的挑战是极端类别不平衡,主要由于训练期间故障数据稀缺所致。本文使用一种反映真实世界工程约束的problem-agnostic模拟数据集,对异常检测算法进行全面评估。我们使用基于超球体的异常分布的合成数据集(在2D和10D中),对14种检测器进行基准测试,训练数据集的异常率在0.05%至20%之间,训练规模在1,000至10,000之间(测试数据集规模为40,000),以评估性能和泛化误差。我们的发现表明,最佳检测器高度取决于训练数据集中故障示例的总数,额外的健康示例在大多数情况下提供的收益微乎其微。在只有20个故障样本以下时,无监督方法(kNN/LOF)占据主导;但在约30-50个故障样本时,半监督方法(XGBOD)和监督方法(SVM/CatBoost)检测器表现大幅提升。尽管在仅有两个特征时,半监督方法未显示显著优势,但在十个特征时,改进效果显著。该研究强调了在更小数据集上对异常检测方法进行泛化的性能下降,并为在工业环境中部署异常检测提供了实用见解。

关键词

引用

@article{arxiv.2601.00004,
  title  = {Finetuning Large Language Models for Automated Depression Screening in Nigerian Pidgin English: GENSCORE Pilot Study},
  author = {Isaac Iyinoluwa Olufadewa and Miracle Ayomikun Adesina and Ezekiel Ayodeji Oladejo and Uthman Babatunde Usman and Owen Kolade Adeniyi and Matthew Tolulope Olawoyin},
  journal= {arXiv preprint arXiv:2601.00004},
  year   = {2026}
}

备注

10 pages, 1 figure, 4 tables