面向欺诈分类的商业拍卖数据爬取与预处理
机器学习
2018-06-19 v2 机器学习
摘要
在过去三十年中,我们通过在线拍卖交易商品和服务的规模显著增长。然而,这一业务为可实施各类欺诈活动(如哄抬竞价(Shill Bidding, SB))的恶意牟利者创造了诱人环境。后者在许多拍卖中占主导,但由于其与正常竞价行为相似,此类欺诈难以检测。SB数据集的缺乏使得SB检测与分类模型的开发十分繁重。此外,为实现高效的SB检测模型,我们应从商业站点的实际拍卖中产生SB数据。本研究中,我们首先爬取了某热门产品的大量eBay拍卖。在对原始拍卖数据预处理后,我们基于最可靠的SB策略构建了高质量的SB数据集。本研究旨在共享预处理后的拍卖数据集以及SB训练(无标签)数据集,从而研究者可利用真实的拍卖与欺诈数据应用多种机器学习技术。
引用
@article{arxiv.1806.00656,
title = {Scraping and Preprocessing Commercial Auction Data for Fraud Classification},
author = {Ahmad Alzahrani and Samira Sadaoui},
journal= {arXiv preprint arXiv:1806.00656},
year = {2018}
}