中文

线性多臂盒中的稀疏探索

机器学习 2025-10-31 v1

摘要

我们研究稀疏探索在线性多臂盒中的问题,弥补了完全自适应探索方法(如 UCB 和 Thompson 抽样)与纯贪心方法之间的显著且被忽视的差距。后者需要严格的上下文多样性假设才能成功。持续探索在安全关键或高成本领域可能不切实际或不道德,而纯贪心策略在缺乏足够上下文多样性时通常会失败。为弥补这两种方法之间的差距,我们引入一种简单且实用的框架——INFEX,专为稀疏探索设计。INFEX 按给定计划执行基本探索策略,同时在两者之间主要选择贪心动作。尽管方法简单,我们的理论分析表明,INFEX 在探索频率超过对数阈值后,即可实现与标准可证高效算法相匹配的实例相关性 regret。此外,INFEX 是一种通用、模块化的框架,可无缝集成任何完全自适应探索方法,实现广泛适用性和易于采纳。通过将资源密集型探索计算限制在稀疏间隔,Our 方法也可提升计算效率。实证评估确认了我们的理论结果,显示在现有方法之上实现了时空最优的 regret 和运行时改进。

关键词

引用

@article{arxiv.2510.26000,
  title  = {Infrequent Exploration in Linear Bandits},
  author = {Harin Lee and Min-hwan Oh},
  journal= {arXiv preprint arXiv:2510.26000},
  year   = {2025}
}

备注

NeurIPS 2025 camera-ready version