面向电商订单欺诈评估的离线强化学习算法基准测试
机器学习
2022-12-07 v1
摘要
Amazon 及其他电商网站必须采用机制保护其数百万客户免受欺诈,例如信用卡盗用。其中一种机制是订单欺诈评估,系统评估订单的欺诈风险,并“放行”订单或采取动作以缓解高风险。订单欺诈评估系统通常使用区分欺诈与合法订单的二分类模型来评估风险并采取动作。我们力求设计一套同时考量欺诈财务损失与长期客户满意度的系统,而错误动作施加于合法客户时会损害满意度。我们提出,将优化长期影响的动作建模为强化学习(Reinforcement Learning, RL)问题。标准 RL 方法需与环境在线交互以学习,但在订单欺诈评估等高风险应用中并不可取。离线 RL 算法从环境采集的日志数据学习,无需在线交互,因而适用于我们的场景。我们表明在 SimStore(一个融入订单欺诈风险的简化电商模拟)中,离线 RL 方法优于传统二分类方案。我们还提出了一种训练离线 RL 策略的新方法,在训练中增加新的损失项,以更好地使策略探索与采取正确动作相对齐。
引用
@article{arxiv.2212.02620,
title = {Benchmarking Offline Reinforcement Learning Algorithms for E-Commerce Order Fraud Evaluation},
author = {Soysal Degirmenci and Chris Jones},
journal= {arXiv preprint arXiv:2212.02620},
year = {2022}
}
备注
2022 NeurIPS Offline Reinforcement Learning Workshop paper