中文

基于环境校正强化学习的自动扣款路径学习

机器学习 2023-06-21 v1 人工智能

摘要

自动扣款是金融科技公司业务运营的重要部分。扣款实践主要基于总额或启发式搜索,将账单拆分为较小部分以尽可能多地扣款。本文提出一种端到端方法,自动学习最优扣款路径(按顺序的扣款金额),降低了人工路径设计成本并最大化成功扣款金额。具体而言,鉴于路径的庞大搜索空间以及历史成功扣款记录的极度稀疏,我们提出一种深度分层强化学习方法,将动作抽象为两级分层空间:上层智能体决定每日扣款步数,下层智能体决定每步扣款金额。以此方式,动作空间通过先验知识被结构化,探索空间得以缩减。此外,业务固有的信息不完备性使环境仅为部分可观测。准确地说,扣款金额仅指示可用账户余额的下界。为此,我们将该问题建模为部分可观测马尔可夫决策过程(POMDP),并依据业务特征采用环境校正算法。在全球最大的电子支付业务中,我们离线验证了该方案的有效性,并将其部署上线服务数百万用户。

关键词

引用

@article{arxiv.2306.10083,
  title  = {Automatic Deduction Path Learning via Reinforcement Learning with Environmental Correction},
  author = {Shuai Xiao and Chen Pan and Min Wang and Xinxin Zhu and Siqiao Xue and Jing Wang and Yunhua Hu and James Zhang and Jinghua Feng},
  journal= {arXiv preprint arXiv:2306.10083},
  year   = {2023}
}