基于变换器语言模型的网络犯罪投诉自动分类:面向Hinglish文本
密码学与安全
2024-12-24 v1 人工智能
机器学习
摘要
网络犯罪的增加以及多语言和代码混合投诉的复杂性为执法部门和网络安全组织带来了显著挑战。这些组织需要自动、可扩展的方法来识别犯罪类型,以高效处理和优先排序大量投诉。手动筛选效率低下,传统机器学习方法无法捕捉文本网络犯罪投诉中的语义和上下文细微差别。此外,缺乏公开数据集和隐私 concerns 也阻碍了研究者开发稳健解决方案。为此,我们提出了一个自动网络犯罪投诉分类框架。该框架利用Hinglish适应变换器模型,如HingBERT和HingRoBERTa,以有效处理代码混合输入。我们采用印度网络犯罪协调中心 (I4C) 在CyberGuard AI Hackathon 2024期间提供的真实世界数据集。我们采用基于生成式AI开源模型的数据增强方法以解决类别不平衡问题。我们还采用隐私意识的预处理以确保遵守伦理标准,同时保持数据完整性。我们的解决方案取得了显著的性能提升,HingRoBERTa实现了74.41%的准确率和71.49%的F1分数。我们还开发了一个集成Django REST后端和现代前端的即用型工具。该工具可扩展,可部署于国家网络犯罪举报门户等实际平台。这一工作填补了网络犯罪投诉管理中的关键空白,为现代网络安全挑战提供了一个可扩展、注重隐私且可适配的解决方案。
引用
@article{arxiv.2412.16614,
title = {Automated Classification of Cybercrime Complaints using Transformer-based Language Models for Hinglish Texts},
author = {Nanda Rani and Divyanshu Singh and Bikash Saha and Sandeep Kumar Shukla},
journal= {arXiv preprint arXiv:2412.16614},
year = {2024}
}