非线性效用的可计算多项式逻辑律情境式多臂老虎机
机器学习
2026-01-13 v1 机器学习
摘要
我们研究的是多项式逻辑律(MNL)情境式多臂老虎机问题,用于顺序组合选择。虽然大多数现有研究假设效用函数是物品特征的线性函数,但这种线性假设限制了对物品与用户偏好之间复杂相互作用的建模。近期工作(Zhang & Luo, 2024)已探讨了一般效用函数类,但其方法在计算可行性与统计效率之间存在根本性权衡。为解决这一限制,我们提出一种针对非线性参数效用函数(包括由神经网络建模的效用函数)的可计算高效算法,专为 MNL 情境式多臂老虎机设计。我们在效用函数类上假设实现可行性和轻微几何条件后,本算法实现 的 regret 上界,其中 表示总轮次。我们的结果表明,即使采用神经网络构建的效用函数,亦可在不依赖神经切线核近似的强假设下,实现 的 regret。据我们了解,我们的方法是首个针对非线性效用的 MNL 情境式多臂老虎机的可计算算法,已证明可实现 的 regret。全面的数值实验验证了我们方法的有效性,显示其在可实现的情况下以及模型误指定情景下均表现出稳健的性能。
引用
@article{arxiv.2601.06913,
title = {Tractable Multinomial Logit Contextual Bandits with Non-Linear Utilities},
author = {Taehyun Hwang and Dahngoon Kim and Min-hwan Oh},
journal= {arXiv preprint arXiv:2601.06913},
year = {2026}
}
备注
Accepted at NeurIPS 2025