LLM-initialized bandits 是跳跃式启动还是错误式启动?理论与实证评估
机器学习
2026-04-06 v1 人工智能
摘要
大型语言模型(LLM)的最新进展为生成用户偏好数据以为 bandits 提供了新的机会。最近针对 LLM 初始化的情境 bandits(CBLI)的研究表明, 这些合成先验显著降低了早期后悔。然而, 这些发现假设LLM 生成的选择与实际用户偏好相当一致。本文系统性地检验了在合成训练数据中注入随机和标签翻转噪声后, LLM 生成的偏好如何表现。对于对齐的领域, 我们发现热启动在30%损坏情况下仍然有效, 在40%左右失去优势, 并在50%以上导致性能下降。当存在系统性不对齐时, 即使未添加噪声, LLM 生成的先验也可能导致比冷启动 bandits 更高的后悔。为解释这些行为, 我们发展了理论分析, 将随机标签噪声和系统性不对齐对驱动 bandits 后悔的先验误差分解, 并推导出LLM 基于热启动显著优于冷启动 bandits的充分条件。我们在多个联合数据集和 LLM 上对这些结果进行了验证, 表明估计的对齐程度可靠地跟踪热启动是改善还是损害推荐质量的时间。
引用
@article{arxiv.2604.02527,
title = {Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits},
author = {Adam Bayley and Xiaodan Zhu and Raquel Aoki and Yanshuai Cao and Kevin H. Wilson},
journal= {arXiv preprint arXiv:2604.02527},
year = {2026}
}
备注
25 pages, 3 figures