基于机器学习和变换模型的多语言金融欺诈检测:孟加拉-英语研究
机器学习
2026-03-13 v1
摘要
金融欺诈检测已成为数字金融平台快速扩张下的关键研究挑战。尽管机器学习方法在识别欺诈活动方面表现出强大性能,但大多数现有研究仅关注英文数据,限制了其在多语言情境中的适用性。孟加拉语(孟加拉语),尽管拥有超过2.5亿使用者,却在此领域基本未被探索。本文在孟加拉-英语语境下使用由合法与欺诈金融信息组成的数据集, investigates 金融欺诈检测。我们评估了使用 TF-IDF 特征的经典机器学习模型(逻辑回归、线性SVM和集成分类器),以及变换器基础架构。通过5折分层交叉验证的实验结果表明,线性SVM achieves 最佳性能,准确率达91.59%,F1分数达91.30%,优于变换器模型(准确率89.49%,F1值88.88%)约2个百分点。变换器 exhibits 更高的欺诈召回率(94.19%),但面临更高的误报率。探索性分析揭示了独特模式:诈骗信息更长,包含紧急引发的术语,频繁包含URL(32%)和电话号码(97%),而合法信息特征为交易确认和特定货币引用。我们的发现表明,经典机器学习配合精心设计的特征在多语言欺诈检测中仍具竞争力,同时也凸显了语言多样性、代码混合和低资源语言限制的挑战。
引用
@article{arxiv.2603.11358,
title = {Multilingual Financial Fraud Detection Using Machine Learning and Transformer Models: A Bangla-English Study},
author = {Mohammad Shihab Uddin and Md Hasibul Amin and Nusrat Jahan Ema and Bushra Uddin and Tanvir Ahmed and Arif Hassan Zidan},
journal= {arXiv preprint arXiv:2603.11358},
year = {2026}
}