基于情境多臂老板的自洽逆向拍卖用于自适应选择
软凝聚态物质
2026-02-17 v1 应用物理
摘要
我们研究了在多个大语言模型 (LLM) 提供者提交解决查询费用的情况下,选择 LLM 以满足用户查询的问题。从用户的角度来看,选择最佳模型是一个顺序的、查询相关的决策问题:高容量模型提供更可靠的输出但成本更高,而轻量级模型更快更便宜。我们将此类互动形式化为具有情境在线学习的逆向拍卖设计问题,用户在聘请竞争性 LLM 提供商的同时自适应发现哪个模型表现最佳。现有的多臂老板 (MAB) 机制专注于正向拍卖和社会福利,留下了逆向拍卖、提供商最优结果和情境适应性挑战。我们通过设计一种基于重抽样的程序来解决这些问题,将真实的正向 MAB 机制推广到逆向拍卖,证明任何具有该程序的单调分配规则都是诚实的。借助该方法,我们提出了一个学习查询相关模型质量的情境 MAB 算法,实现亚线性后悔。我们的框架统一了机制设计和自适应学习,使能够高效、诚实且查询感知的 LLM 选择成为可能。
引用
@article{arxiv.2602.14475,
title = {Self-Viscophoresis: Autonomous Motion by Biasing Thermal Fluctuations via Self-Generated Viscosity Asymmetry},
author = {Bokusui Nakayama and Yusuke Takagi and Ryoya Hirose and Masatoshi Ichikawa and Marie Tani and Ibuki Kawamata and Eiji Yamamoto and Akira Kakugo},
journal= {arXiv preprint arXiv:2602.14475},
year = {2026}
}
备注
main manuscript: 13 pages including 5 figures, supplemental material: 9 pages including 7 figures and 4 movies (.mp4)