中文

LIBRA:用于个性化治疗规划的语言模型信息增强的赌博机反事实算法

人工智能 2026-01-21 v1 机器学习 统计理论 统计理论

摘要

我们引入了一个统一框架,该框架无缝集成了算法反事实、上下文赌博机和大语言模型(LLM),以支持个性化医疗等高风险环境中的序列决策。我们首先引入了反事实赌博机问题,其中决策者必须同时选择一个治疗行动和对可改变的患者特征进行可行且最小的修改。为解决此问题,我们开发了广义线性反事实赌博机(GLRB)算法。在此基础上,我们提出了 LIBRA,一种语言模型信息增强的赌博机反事实算法,该算法策略性地将来自 LLM 的领域知识与赌博机学习的统计严谨性相结合。LIBRA 提供了三个关键保证:(i) 热启动保证,表明当 LLM 推荐接近最优时,LIBRA 能显著降低初始遗憾;(ii) LLM 努力保证,证明该算法仅需咨询 LLM O(log2T)O(\log^2 T) 次,其中 TT 是时间范围,确保了长期自主性;(iii) 鲁棒性保证,表明即使 LLM 不可靠,LIBRA 的表现也绝不会比纯赌博机算法差。我们进一步建立了匹配的下界,刻画了反事实赌博机问题的基本难度,并证明了我们算法的近优性。在合成环境和真实高血压管理案例研究上的实验证实,与标准上下文赌博机和仅使用 LLM 的基准相比,GLRB 和 LIBRA 在遗憾值、治疗质量和样本效率方面均有提升。我们的结果突显了反事实感知、LLM 辅助的赌博机算法在个性化高风险决策中实现可信的 LLM-赌博机协作的前景。

关键词

引用

@article{arxiv.2601.11905,
  title  = {LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning},
  author = {Junyu Cao and Ruijiang Gao and Esmaeil Keyvanshokooh and Jianhao Ma},
  journal= {arXiv preprint arXiv:2601.11905},
  year   = {2026}
}

备注

50 pages. Previous version with human-AI collaboration: arXiv:2410.14640