中文

面向纯探索的上下文学习

机器学习 2026-03-03 v3 人工智能

摘要

我们研究主动序列假设检验问题,也称为纯探索:给定一个新任务,学习者自适应地从环境中收集数据,以高效地确定潜在的正确假设。该问题的一个经典实例是在多臂老虎机问题中识别最佳臂(又称 BAI,Best-Arm Identification),其中动作索引假设。另一个重要情形是广义搜索,即通过一系列策略性选择的查询间接揭示关于标签的信息,从而确定正确标签的问题。在本工作中,我们引入了上下文纯探索器(ICPE),对 Transformer 进行元训练,将观测历史映射到查询动作和预测假设,从而产生一个可进行上下文迁移的模型。在推理阶段,ICPE 在新任务上主动收集证据并推断真实假设,而无需参数更新。在包括 BAI 和广义搜索的确定性、随机和结构化基准测试中,ICPE 与自适应基线具有竞争力,且无需对信息结构进行显式建模。我们的结果支持将 Transformer 作为通用序列检验的实用架构。

关键词

引用

@article{arxiv.2506.01876,
  title  = {In-Context Learning for Pure Exploration},
  author = {Alessio Russo and Ryan Welch and Aldo Pacchiano},
  journal= {arXiv preprint arXiv:2506.01876},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026