连续空间中的原位学习
机器学习
2026-02-23 v1 人工智能
摘要
在主动顺序测试(亦称纯原位探索)中,学习者需以最少的查询次数来获取信息,以识别未知的真实假设。该问题由 Chernoff 在1959年提出,经典形式包括在多臂盒子中进行最佳臂识别(BAI),其中动作索引假设;或广义搜索问题,其中战略性选择的查询揭示关于隐藏标签的部分信息。在许多现代场景下,假设空间为连续且自然对应于查询/动作空间:例如,在连续臂盒子中识别最优动作、局部定位包含于目标区域的 球,或从一系列观测中估计未知函数的最小值。在本工作中,我们研究连续空间中的纯原位探索,提出 Continuous In-Context Pure Exploration(C-ICPE)方法。我们引入 C-ICPE-TS 算法,通过深度神经网络策略将观察历史映射为(i)下一个连续查询动作和(ii)预测的假设,从而直接从数据中学习可迁移的顺序测试策略。在推断阶段,C-ICPE-TS 在未出现的任务上主动收集证据,无需参数更新或显式 hand-crafted 信息模型,即可推断真实假设。我们在各种基准测试上验证了 C-ICPE-TS,涵盖连续最佳臂识别、区域定位和函数最小值识别。
引用
@article{arxiv.2602.17976,
title = {In-Context Learning for Pure Exploration in Continuous Spaces},
author = {Alessio Russo and Yin-Ching Lee and Ryan Welch and Aldo Pacchiano},
journal= {arXiv preprint arXiv:2602.17976},
year = {2026}
}