利用强化学习建模顾客轨迹以获取实用的零售洞察
机器学习
2026-05-19 v1 人工智能
摘要
理解顾客在零售空间内的移动对于优化门店布局至关重要。真实世界的轨迹数据可以提供高精度的洞察,但收集这些数据成本高昂,且对许多零售商而言往往不可行。诸如旅行商问题(TSP)和概率最近邻(PNN)等启发式方法常被用作低成本的近似,但实际顾客轨迹与最短路径平均偏离 28%,凸显了准确性与实用性之间的权衡。我们提出了一个基于智能体的建模框架,将顾客轨迹预测转化为一个最大熵强化学习(RL)问题,在奖励最大化与随机性之间取得平衡,以更好地反映有限理性的顾客。使用来自便利店的真实世界轨迹数据,我们表明 RL 生成的轨迹比 TSP 和 PNN 更贴近顾客行为,为冲动购买率和货架客流密度提供了更准确的估计。此外,只有基于 RL 的预测能产生与从实际轨迹数据得出的相一致的冲动产品重新定位决策,从而带来可比的估计利润增益。我们的工作表明,RL 提供了一种实用的、基于行为的替代方案,弥合了过度简化的启发式方法与数据密集型方法之间的差距,使准确的布局优化更易获得。为了鼓励进一步研究,源代码已在 GitHub 上提供。
引用
@article{arxiv.2605.18449,
title = {Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights},
author = {Ken Ming Lee and Paul Barde and Maxime C. Cohen and Derek Nowrouzezahrai},
journal= {arXiv preprint arXiv:2605.18449},
year = {2026}
}
备注
Proceeding of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)