位置感知多项式逻辑赤字带学习:从乘法到通用位置效应
机器学习
2026-05-19 v1 机器学习
摘要
我们研究了动态联合选品与定位问题,其中每个产品的吸引力取决于其内在吸引力以及其显示位置,基于多项式逻辑(Multinomial Logit, MNL)选择框架。我们的研究范围从乘法位置效应模型(其中每个产品的吸引力按位置特定因子缩放)到通用位置效应模型(为每个产品-位置对分配独立的吸引力参数,以捕捉异质性协同效应)。对于这两种模型,我们设计了基于轮次的学习算法,在每一次反馈后更新决策,并建立了首个 regret 最优的特征。此外,我们的轮次算法提供了现代平台所需的即时操作。对于乘法模型,我们开发了带剪裁机制的跨位置成对最大似然估计器,证明我们的算法P2MLE-UCB的regret为,与下界相符,弥补了先前基于epoch分析留下的间隙。对于通用模型,我们建立了minimax下界,提出GP2-UCB并给出匹配的上界。此外,我们基于Dinkelbach方法和最大权二分匹配,设计了一个用于每轮联合选品与定位优化的高效子程序。数值实验在合成数据和Expedia数据集上表明,我们的算法 consistently 超过了最先进的基准。
引用
@article{arxiv.2605.17238,
title = {Learning in Position-Aware Multinomial Logit Bandits: From Multiplicative to General Position Effects},
author = {Xi Chen and Shibo Dai and Jiameng Lyu and Yuan Zhou},
journal= {arXiv preprint arXiv:2605.17238},
year = {2026}
}