支付处理中的情境性偏置:非均匀探索与监督学习
机器学习
2025-07-11 v2 信息检索
摘要
决策系统中的均匀随机探索支持通过监督学习实现离策略学习,但会产生高 regret,使其在许多应用中不够实用。相比,非均匀探索能提供更好的即时性能,但缺乏对离策略学习的支持。最近的研究表明,回归oracle可以桥接这一鸿沟,通过结合非均匀探索与监督学习。在本文中,我们在Adyen这家大型全球支付处理公司的实际业务环境中分析了这些方法,该公司具有批处理日志延迟反馈、短期记忆和动态动作空间,在经验风险最小化(ERM)框架下进行分析。我们的分析显示,尽管回归oracle显著提高了性能,但由于算法假设僵化,他们会引入挑战。具体而言,我们观察到随着策略改进,后续生成的策略可能表现更差,这是由于奖励分布的偏移以及训练数据中类别不平衡的增加造成的。尽管在其他方面的训练数据有所改进,导致后续策略迭代的性能下降。我们进一步探讨了回归oracle的长期影响,识别出一种潜在的“振荡效应”。这种效应是由于回归oracle影响概率估计和后续策略模型的可实现性,导致跨迭代性能波动。我们的结果表明,需要更具适应性的算法,才能在不引入策略性能随时间不稳定性的前提下,利用回归oracle的优势。
引用
@article{arxiv.2412.00569,
title = {Contextual Bandits in Payment Processing: Non-uniform Exploration and Supervised Learning},
author = {Akhila Vangara and Alex Egg},
journal= {arXiv preprint arXiv:2412.00569},
year = {2025}
}
备注
7 pages, 10 figures, submitted to KDD '25