中文

使用机器学习检测奇契瓦语中的欺诈短信

机器学习 2025-02-25 v1 计算与语言

摘要

短信欺诈在全球范围内备受关注。基于机器学习构建短信欺诈分类器需要使用合适的数据集进行模型训练和验证。大多数研究集中在使用英文短信数据集上。本文引入了首个用于奇契瓦语(非洲的一种主要语言)短信欺诈检测的数据集,并报告了使用机器学习算法将奇契瓦语短信分类为欺诈或非欺诈的实验。我们回答了为奇契瓦语短信开发机器学习分类模型可行性如何这一更广泛的研究问题。为此,我们创建了三个数据集。通过初步研究从部分年轻人群中收集了一个小型的奇契瓦语短信数据集。我们应用了保留标签的文本转换来增加其规模。扩充后的数据集使用两种方法翻译成英文:人工翻译和机器翻译。使用随机森林和逻辑回归对奇契瓦语数据集及翻译后的数据集进行机器分类。我们的研究结果表明,这两个模型在奇契瓦语数据集上均取得了超过 96% 的理想准确率。从奇契瓦语数据集转移到翻译数据集时,性能出现下降。这凸显了数据预处理的重要性,尤其是在多语言或跨语言 NLP 任务中,并表明了依赖机器翻译文本训练机器学习模型的挑战。我们的结果强调了开发针对特定语言的短信欺诈检测模型以优化准确率和性能的重要性。由于大多数机器学习模型需要数据预处理,因此有必要研究依赖特定英语工具进行数据预处理的影响。

关键词

引用

@article{arxiv.2502.16947,
  title  = {Using Machine Learning to Detect Fraudulent SMSs in Chichewa},
  author = {Amelia Taylor and Amoss Robert},
  journal= {arXiv preprint arXiv:2502.16947},
  year   = {2025}
}