基于特征扰动的情境型多臂赌徒问题中的探索
机器学习
2025-10-27 v2 机器学习
摘要
我们提出了一种称为特征扰动的探索策略,该策略直接向特征输入注入随机性,而非随机化未知参数或向奖励添加噪声。这一算法为广义线性情境型多臂赌徒问题实现了 的最坏情况 regret 上界,超越了现有随机化多臂赌徒算法通常具有的 复杂度。由于本算法不采用参数抽样,故计算高效,且天然适用于非参数或神经网络模型。我们通过实证评估验证了这些优势,表明特征扰动不仅超越了现有方法,还在实现接近最优 regret 保证的同时,展现出强劲的实际性能。
引用
@article{arxiv.2510.17390,
title = {Exploration via Feature Perturbation in Contextual Bandits},
author = {Seouh-won Yi and Min-hwan Oh},
journal= {arXiv preprint arXiv:2510.17390},
year = {2025}
}
备注
Accepted at NeurIPS 2025 (spotlight)