中文

基于自然语言处理的非法暗网分类:基于文本信息的网页非法内容分类

信息检索 2023-12-11 v1 计算机与社会

摘要

本研究旨在扩展先前在非法活动分类领域的工作,分三个不同步骤进行。首先,我们创建了一个包含 113995 个洋葱站点和暗网市场的异构数据集。然后,我们将预训练的可迁移模型,即 ULMFit(通用语言模型微调)、Bert(来自 Transformer 的双向编码器表示)和 RoBERTa(稳健优化的 BERT 方法),与传统的文本分类方法如 LSTM(长短期记忆)神经网络进行了比较。最后,我们开发了两种非法活动分类方法,一种用于暗网上的非法内容,另一种用于识别特定类型的毒品。结果表明,Bert 获得了最佳效果,对暗网一般内容和毒品类型的分类准确率分别达到 96.08% 和 91.98%。

关键词

引用

@article{arxiv.2312.04944,
  title  = {Illicit Darkweb Classification via Natural-language Processing: Classifying Illicit Content of Webpages based on Textual Information},
  author = {Giuseppe Cascavilla and Gemma Catolino and Mirella Sangiovanni},
  journal= {arXiv preprint arXiv:2312.04944},
  year   = {2023}
}