时间约束推荐:电子商务中的强化学习策略
机器学习
2026-04-15 v1 人工智能
摘要
与传统推荐任务不同,有限的用户时间预算引入了关键的资源约束,要求推荐系统在物品相关性和评估成本之间取得平衡。例如,在移动购物界面中,用户通过滑动与推荐进行交互,每次滑动会触发一个称为slate的物品列表。用户承担评估成本——即在决定点击之前评估物品特征所花费的时间。高度相关的物品若具有较高的评估成本,可能超出用户的时间预算,从而影响参与度。在这篇立场论文中,我们的目标是评估能够同时学习用户偏好和时间预算模式的强化学习算法,在资源约束下生成具有更高参与潜力的推荐。我们的实验探索了使用强化学习为用户提供推荐的方法,采用阿里巴巴的个性化重排数据集,该数据集支持电子商务场景中的slate优化。我们的贡献包括:(i)将时间约束slate推荐统一建模为具有预算感知效用的马尔可夫决策过程(MDP);(ii)一个用于研究重排数据上策略行为的仿真框架;以及(iii)实证证据表明,在紧张的时间预算下,on-policy和off-policy控制比传统的基于上下文bandit的方法能提升性能。
引用
@article{arxiv.2512.13726,
title = {Time-Constrained Recommendations: Reinforcement Learning Strategies for E-Commerce},
author = {Sayak Chakrabarty and Souradip Pal},
journal= {arXiv preprint arXiv:2512.13726},
year = {2026}
}
备注
9 pages, 5 figures