中文

基于特征扰动的情境型多臂赌徒问题中的探索

机器学习 2025-10-27 v2 机器学习

摘要

我们提出了一种称为特征扰动的探索策略,该策略直接向特征输入注入随机性,而非随机化未知参数或向奖励添加噪声。这一算法为广义线性情境型多臂赌徒问题实现了 O~(dT)\tilde{\mathcal{O}}(d\sqrt{T}) 的最坏情况 regret 上界,超越了现有随机化多臂赌徒算法通常具有的 O~(d3/2T)\tilde{\mathcal{O}}(d^{3/2}\sqrt{T}) 复杂度。由于本算法不采用参数抽样,故计算高效,且天然适用于非参数或神经网络模型。我们通过实证评估验证了这些优势,表明特征扰动不仅超越了现有方法,还在实现接近最优 regret 保证的同时,展现出强劲的实际性能。

关键词

引用

@article{arxiv.2510.17390,
  title  = {Exploration via Feature Perturbation in Contextual Bandits},
  author = {Seouh-won Yi and Min-hwan Oh},
  journal= {arXiv preprint arXiv:2510.17390},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 (spotlight)