在产品组合决策下的新产品最优探索
社会与信息网络
2026-05-26 v2 计算机科学与博弈论
机器学习
摘要
我们研究在平台上进行新产品在线学习的问题,平台需在产品组合受容量限制的条件下决定面向哪些产品。对于新上架的产品,其质量初始未知,质量信息通过社交学习传播:当客户购买新产品并留下评论后,其质量会被平台及后续客户所了解。由于评论需要购买,平台必须将新产品纳入组合(“探索”)以生成评论以学习新产品。这种探索成本较高,因为客户对新产品的需求低于成熟产品。我们描述了在此设置下最小化后悔的优化组合,回答了两个问题。(1)平台应单独提供新产品,还是与成熟产品一起提供?后者可最大化新产品的购买概率,但会导致短期收入较低。尽管购买概率较低,我们证明了始终以与顶级成熟产品组合的做法最优。(2)在多款新产品情况下,平台应同时探索还是逐一探索?我们指出,同时探索的新产品数量具有简单的阈值结构:随着新产品的“潜力”增加而增加,令人惊讶的是,这并不取决于它们各自的购买概率。我们还指出,两个标准 bandit 算法,即 UCB 和 Thompson 采样,分别在此设置下因相反的原因而失败:UCB 过度探索,而 Thompson 采样则低估了探索。我们的结果为平台通过组合决策学习新产品提供了结构性见解。
引用
@article{arxiv.2604.18800,
title = {Optimal Exploration of New Products under Assortment Decisions},
author = {Jackie Baek and Atanas Dinev and Thodoris Lykouris},
journal= {arXiv preprint arXiv:2604.18800},
year = {2026}
}