SAGE:面向欺诈检测中可信负样本收获的可扩展自动门控集成
机器学习
2026-05-20 v1 密码学与安全
信息检索
摘要
音乐流媒体欺诈行为——即恶意行为者人为制造流量以操纵排行榜和版权金支付——是威胁流媒体服务及合法内容创作者的重大挑战。传统欺诈检测方法面临一个关键难题:许多合法边缘情况(包括超级粉丝和睡眠音乐会)呈现的活动模式与协调型欺诈行为高度相似。我们提出SAGE(Scalable Automatic Gating Ensemble),一种新型的、基于反事实认知的负样本收获方法,将SimHash 基于分层抽样与模块化门控集成相结合,用于从未标记数据中实现可信负样本识别。该集成架构采用可插拔统计门控(目前采用马哈拉里斯距离和k-近邻密度)并支持可配置的投票阈值,以实现自适应的精确率-召回率权衡。这解决了正-未标记学习中表示偏差问题,通过保障对稀有行为群体的全面覆盖(受地板约束抽样),从而实现可靠的负样本识别。评估结果表明,该方法在保留样本上的精确率和召回率均表现出色。该方法可推广至欺诈检测的其他领域,无需修改核心方法即可在客户层面和艺术家层面的欺诈检测中实现卓越性能。
引用
@article{arxiv.2605.20157,
title = {SAGE: Scalable Automatic Gating Ensemble for Confident Negative Harvesting in Fraud Detection},
author = {Sudheer Tubati and Amit Goyal},
journal= {arXiv preprint arXiv:2605.20157},
year = {2026}
}