中文

深度强化学习在支付欺诈中的应用

机器学习 2021-12-09 v1 人工智能

摘要

如今消费者可用的数字支付选择种类繁多,这已成为过去十年电子商务交易的关键驱动力。不幸的是,这也催生了网络犯罪分子和欺诈者,他们通过部署日益复杂的欺诈攻击,不断寻找这些系统中的漏洞。典型的欺诈检测系统采用标准的监督学习方法,其重点是最大化欺诈召回率。然而,我们认为这种形式可能导致次优解。这些欺诈模型的设计要求它们对数据中的高度类别不平衡具有鲁棒性,能适应欺诈模式的变化,在欺诈率和拒绝率之间保持平衡以最大化收入,并且能够适应异步反馈,因为交易与欺诈实现之间通常存在显著的时间滞后。为了实现这一点,我们通过将效用最大化以奖励函数的形式包含在模型内,将欺诈检测制定为一个顺序决策问题。历史拒绝率和欺诈率定义了系统的状态,其二元动作空间由批准或拒绝交易组成。在本研究中,我们主要关注效用最大化,并为此探索了不同的奖励函数。所提出的强化学习系统的性能已在两个公开可用的欺诈数据集上使用深度 Q 学习进行了评估,并与不同的分类器进行了比较。我们计划在未来的工作中解决其余问题。

关键词

引用

@article{arxiv.2112.04236,
  title  = {Application of Deep Reinforcement Learning to Payment Fraud},
  author = {Siddharth Vimal and Kanishka Kayathwal and Hardik Wadhwa and Gaurav Dhama},
  journal= {arXiv preprint arXiv:2112.04236},
  year   = {2021}
}

备注

Multi-Armed Bandits and Reinforcement Learning: Advancing Decision Making in E-Commerce and Beyond at KDD 2021