一种用于检测移动端仿冒应用的多模态神经嵌入方法:以 Google Play 商店为例
密码学与安全
2020-06-04 v1 计算机视觉与模式识别
神经与进化计算
摘要
仿冒应用冒充现有热门应用,试图误导用户安装它们,目的各异,如收集个人信息或传播恶意软件。许多仿冒应用在安装后即可被识别,但即便是精通技术的用户,在安装前也可能难以察觉。为此,本文提出利用深度学习方法的近期进展来创建图像与文本嵌入,从而在仿冒应用提交发布时即可高效识别。我们展示了一种结合内容嵌入与风格嵌入的新颖方法,其性能优于 SIFT、SURF 及各种图像哈希等图像相似性基线方法。我们首先在两个知名的图像相似性评估数据集上评估所提方法的性能,结果表明在检索五个最近邻时,内容、风格及组合嵌入分别使 precision@k 和 recall@k 提升了 10%–15% 和 12%–25%。其次,针对应用仿冒检测这一具体问题,与基线方法相比,内容与风格组合嵌入使 precision@k 和 recall@k 分别提升了 12% 和 14%。第三,我们对来自 Google Play 商店约 120 万款应用进行分析,并为前 10,000 款热门应用识别出一组潜在仿冒应用。在保守假设下,我们于 49,608 款与 Google Play 商店前 10,000 款热门应用之一高度相似的应用中,发现了 2,040 款含有恶意软件的潜在仿冒应用。我们还发现 1,565 款索取比原应用至少多五项危险权限的潜在仿冒应用,以及 1,407 款至少多出五个第三方广告库的潜在仿冒应用。
引用
@article{arxiv.2006.02231,
title = {A Multi-modal Neural Embeddings Approach for Detecting Mobile Counterfeit Apps: A Case Study on Google Play Store},
author = {Naveen Karunanayake and Jathushan Rajasegaran and Ashanie Gunathillake and Suranga Seneviratne and Guillaume Jourjon},
journal= {arXiv preprint arXiv:2006.02231},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:1804.09882