中文

基于语言模型的半监督集成框架:用于深网/暗网和社交平台非法市场检测

计算与语言 2025-08-01 v1 人工智能 机器学习

摘要

非法市场正越来越多地转向互联网的隐蔽区域,包括深网和暗网,以及诸如电报(Telegram)、Reddit 和 Pastebin 等平台。这些渠道使匿名贸易非法商品(包括毒品、武器和盗取的凭证)成为可能。由于标签数据有限、非法语言不断演变以及在线来源结构异构性,检测和分类此类内容仍具有挑战性。本文提出了一种层次化分类框架,结合微调的语言模型与半监督集成学习策略,用于跨不同平台检测和分类非法市场内容。我们使用ModernBERT——一种用于长文档的变换模型,通过在深网网页、电报频道、Subreddit 和 Pastebin 粘贴的领域特定数据上进行微调,来捕获专业术语和模糊语言模式。此外,我们还融入了手动工程特征,包括文档结构、嵌入模式(如比特币地址、电子邮件和IP地址)以及元数据,这些特征补充了语言模型嵌入。分类管道分为两个阶段:第一阶段使用带有熵率加权投票的 XGBoost、随机森林和 SVM 的半监督集成,用于检测与销售相关的文档;第二阶段进一步将这些文档分类为毒品、武器或凭证销售。实验在包含我们多源语料库、DUTA 和 CoDA 的三个数据集上进行,结果表明该模型优于多个基线模型(包括BERT、ModernBERT、DarkBERT、ALBERT、Longformer 和 BigBird),实现准确率为0.96489,F1分数为0.93467,TMCC为0.95388,显示出强大的泛化能力、在有限监督下的鲁棒性以及在实际场景中处理非法内容检测的有效性。

关键词

引用

@article{arxiv.2507.22912,
  title  = {A Language Model-Driven Semi-Supervised Ensemble Framework for Illicit Market Detection Across Deep/Dark Web and Social Platforms},
  author = {Navid Yazdanjue and Morteza Rakhshaninejad and Hossein Yazdanjouei and Mohammad Sadegh Khorshidi and Mikko S. Niemela and Fang Chen and Amir H. Gandomi},
  journal= {arXiv preprint arXiv:2507.22912},
  year   = {2025}
}

备注

16 pages, 5 figures, 9 tables