中文

基于文本和元数据分析的 Hajj 和 Umrah 旅游agency身份识别机器学习算法

机器学习 2025-12-19 v1

摘要

印度尼西亚 Hajj 和 Umrah 服务的数字化快速进程显著便利了朝圣者,但同时也为通过仿冒移动应用程序开展数字欺诈提供了便利。这些仿冒应用程序不仅造成经济损失,还会通过收集敏感个人数据对用户造成严重的隐私风险。为此,本研究旨在通过自动实现应用程序身份验证来解决此关键问题。我们使用包含 Ministry of Religious Affairs 注册的官方应用程序以及在应用商店上流通的非官方应用程序的全面数据集,比较了三种稳健的分类器:支持向量机(SVM)、随机森林(RF)和朴素贝叶斯(NB)。该研究采用混合特征提取方法,将应用程序描述的文本分析(TF-IDF)与敏感访问权限的元数据分析相结合。实验结果表明,SVM算法在准确率达92.3%、精确率达91.5%、F1分数达92.0%时取得最佳性能。详细的特征分析揭示,与合法性相关的特定关键词以及高风险权限(如 READ PHONE STATE)是最重要的判别因子。该系统被提议作为一种主动、可扩展的解决方案,以增强宗教旅游部门的数字信任,可能作为全国验证系统的原型。

关键词

引用

@article{arxiv.2512.16742,
  title  = {Machine Learning Algorithms: Detection Official Hajj and Umrah Travel Agency Based on Text and Metadata Analysis},
  author = {Wisnu Uriawan and Muhamad Veva Ramadhan and Firman Adi Nugraha and Hasbi Nur Wahid and M Dantha Arianvasya and Muhammad Zaki Alghifari},
  journal= {arXiv preprint arXiv:2512.16742},
  year   = {2025}
}