利用BERT和字符级CNN检测孟加拉语短信诈骗的混合机器学习模型
计算与语言
2025-08-26 v1 机器学习
社会与信息网络
摘要
短信诈骗是一种社会工程攻击,利用包含恶意内容的短信欺骗个人泄露敏感信息或向网络犯罪分子转账。短信诈骗攻击激增了328%,对移动用户构成重大威胁,2019年损失超过5420万美元。尽管其日益普遍,但该问题仍未得到充分解决。本文提出了一种新颖的混合机器学习模型,用于检测孟加拉语短信诈骗文本,该模型结合了来自Transformer的双向编码器表示(BERT)与卷积神经网络(CNN),以增强字符级分析。我们的模型通过区分普通、促销和诈骗短信来解决多类分类问题。与传统的二分类方法不同,我们的方法整合了BERT的上下文嵌入与CNN的字符级特征,提高了检测精度。通过注意力机制增强,该模型有效地优先处理关键文本片段。我们的模型达到了98.47%的准确率,优于传统分类器,在诈骗短信检测中具有高精确率和召回率,并在所有类别中表现出色。
引用
@article{arxiv.2502.01518,
title = {Hybrid Machine Learning Model for Detecting Bangla Smishing Text Using BERT and Character-Level CNN},
author = {Gazi Tanbhir and Md. Farhan Shahriyar and Khandker Shahed and Abdullah Md Raihan Chy and Md Al Adnan},
journal= {arXiv preprint arXiv:2502.01518},
year = {2025}
}
备注
Conference Name: 13th International Conference on Electrical and Computer Engineering (ICECE 2024)