中文

探测后提交多目标臂 bandit:有限多臂反馈的理论优势

机器学习 2026-02-23 v2

摘要

我们研究了一个受多无线接入选择和移动边缘计算卸载启发的在线资源选择问题。在每个回合中,一个代理人从 KK 个候选链接/服务器(臂)中进行选择,其性能是一个随机的 dd 维向量(例如吞吐量、延迟、能耗、可靠性)。关键交互是“探测后提交(PtC)”:该代理人可通过控制平面测量来探测最多 q>1q>1 个候选者以观察其向量结果,但必须在数据平面中执行恰好一个候选者。这种有限的多臂反馈模式严格地在经典 bandit(q=1q=1)和全信息专家(q=Kq=K)之间进行插值,但现有的多目标学习理论主要关注这些极端情况。我们开发了 \textsc{PtC-P-UCB},一种乐观的探测后提交算法,其技术核心是受不确定性支配性超体积前沿区域的前沿感知,在一个帕累托模式下工作,例如它通过大约最大化类似超体积的前沿覆盖潜力来选择 qq 个探测器,并通过边际超体积收益来提交,从而直接扩大所达到的帕累托区域。我们证明了支配性超体积前沿误差为 O~(KPd/qT)\tilde{O} (K_P d/\sqrt{qT}),其中 KPK_P 为帕累托前沿大小,TT 为时间步长;以及标量化 regret 为 O~(Lϕd(K/q)T)\tilde{O} (L_\phi d\sqrt{(K/q)T}),其中 ϕ\phi 为标量化器。这些结果量化了有限探测的透明 1/q1/\sqrt{q} 加速。我们进一步扩展到“多模态探测”:每个探测返回 MM 种模态(例如 CSI、队列、计算遥测),不确定性融合通过有效噪声尺度实现方差自适应版本的上述界限。

关键词

引用

@article{arxiv.2602.03175,
  title  = {Probe-then-Commit Multi-Objective Bandits: Theoretical Benefits of Limited Multi-Arm Feedback},
  author = {Ming Shi},
  journal= {arXiv preprint arXiv:2602.03175},
  year   = {2026}
}