Botcha:在真实场景中检测恶意非人类流量
机器学习
2021-03-03 v1
摘要
恶意机器人约占网页全部流量的四分之一,并降低了电子商务网站上个性化与推荐算法的性能。正-未标记学习(PU learning)提供了仅使用正例(P)与未标记(U)样本训练二分类器的能力。未标记数据包含正类与负类。可以为非恶意行为体的严格子集找到标签,例如假设只有人类在网页会话中购买或清除 CAPTCHA。然而,由于机器人不断演化且具有对抗性,几乎不可能找到恶意行为的信号。这种设定自然适合于 PU 学习。遗憾的是,标准 PU 学习方法假设标记正例集合是所有正例的随机样本,这在实际中不太可能成立。本工作中,我们提出对 PU 学习的两处改进,使其对选中完全随机假设的违背更具鲁棒性,从而得到可过滤恶意机器人的系统。在一个公开和一个专有数据集上,我们表明所提方法比标准 PU 学习方法更能识别网页数据中的人类。
引用
@article{arxiv.2103.01428,
title = {Botcha: Detecting Malicious Non-Human Traffic in the Wild},
author = {Sunny Dhamnani and Ritwik Sinha and Vishwa Vinay and Lilly Kumari and Margarita Savova},
journal= {arXiv preprint arXiv:2103.01428},
year = {2021}
}