中文

离散选择环境下双层优化的因果感知基础模型

机器学习 2026-05-11 v1 最优化与控制

摘要

我们引入了一个因果感知的基础模型框架,用于离散选择环境中的实时最优决策。我们提出了一个约束三头价格优化 (C3PO) 网络来解决一个双层决策问题,其中服务提供商选择最优商品组合,而异构用户做出个性化的接受或拒绝选择以优化其自身的个性化偏好。C3PO 集成了对价格的模仿学习、对收入响应的多任务学习以及对价格弹性的上下文学习,以在遵守业务约束的同时生成定价建议。在推理期间,前沿模型提示从行为经济学文献中为新产品检索增强的弹性先验,从而提高定价有效性。我们使用模拟、合成和真实世界数据集展示了强大的上下文学习性能。C3PO 在由经济学中的多个经典离散选择模型生成的模拟数据上进行训练。该模型在包含模拟客户细分以及反事实动作与结果对的数据上进行训练,并在无法访问底层偏好结构的随机生成选择环境中进行评估。训练后的模型持续改善定价 KPI,且随着客户价格敏感度的增加,收益也增加。我们还将微调后的基础模型部署在医疗保健、投标定价、航空公司辅助产品定价等真实世界应用中以进行最优定价,在多个产品、市场和部门中取得了实质性收益。

关键词

引用

@article{arxiv.2605.06941,
  title  = {Causal-Aware Foundation-Model for Bilevel Optimization in Discrete Choice Settings},
  author = {Shivaram Subramanian and Zhengliang Xue and Markus Ettl and Yingdong Lu and Jayant Kalagnanam},
  journal= {arXiv preprint arXiv:2605.06941},
  year   = {2026}
}