基于校准门控的大语言模型伪观测用于在线情境型多臂老虎机
机器学习
2026-04-17 v1 人工智能
摘要
情境型多臂老虎机算法在冷启动阶段(学习者数据不足以区分优劣臂时)会产生高 regret。我们提出通过大语言模型伪观测增强 Disjoint LinUCB:每轮后,大语言模型预测未被播放的臂的反事实奖励,这些预测被注入学习器作为加权伪观测。注入权重由校准门控衰减schedule控制,该schedule通过指数移动平均跟踪大语言模型在已播放臂上的预测准确性;校准误差高时抑制大语言模型的影响,而准确预测在关键早期轮次中获得更高权重。我们在两个情境型多臂老虎机环境上进行评估——UCI Mushroom(2臂、非对称奖励)和 MIND-small(5臂新闻推荐),结果表明在配合任务特定提示词时,大语言模型伪观测可将 MIND 上的累积 regret 降低 19%。然而,通用反事实提示词框架会导致两个环境的 regret 增加,表明提示词设计是决定性因素,其重要性远超衰减schedule 或校准门控参数的选择。我们分析校准门控在小预测误差域的失效模式,并提供伪观测权重偏差-方差权衡的理论动机。
引用
@article{arxiv.2604.14961,
title = {Calibration-Gated LLM Pseudo-Observations for Online Contextual Bandits},
author = {Maksim Pershin and Ivan Golovanov and Pavel Baltabaev and Natalia Trankova},
journal= {arXiv preprint arXiv:2604.14961},
year = {2026}
}