中文

海关进口申报数据集

机器学习 2023-09-06 v3 人工智能 其他统计学

摘要

鉴于跨境流动的巨大体量,有效且高效的贸易管控在保护人民与社会免受非法贸易侵害方面变得愈发关键。然而,交易级贸易数据集的有限可及性阻碍了开放研究的进展,且许多海关管理部门尚未从近期基于数据的风险管理进展中受益。本文中,我们引入一个进口申报数据集,以促进海关管理部门领域专家与来自数据科学、机器学习等多元领域的研究人员之间的协作。该数据集包含 54,000 条人工生成的贸易记录及 22 个关键属性,其通过条件表格 GAN(conditional tabular GAN)合成,同时保留了相关特征。合成数据具有若干优势。首先,发布该数据集不受禁止披露原始进口数据之限制。伪造步骤最小化了贸易统计中可能存在的身份风险。其次,已发布数据遵循与源数据相似的分布,从而可用于各类下游任务。因此,我们的数据集可用作测试任何分类算法性能的基准。借助所提供的数据及其生成过程,我们开放了用于欺诈检测任务的基线代码,并经实证表明更先进的算法能更好地检测欺诈。

关键词

引用

@article{arxiv.2208.02484,
  title  = {Customs Import Declaration Datasets},
  author = {Chaeyoon Jeong and Sundong Kim and Jaewoo Park and Yeonsoo Choi},
  journal= {arXiv preprint arXiv:2208.02484},
  year   = {2023}
}

备注

Datasets: https://github.com/Seondong/Customs-Declaration-Datasets