令人愉悦的探索
机器学习
2026-05-14 v1 人工智能
最优化与控制
机器学习
摘要
大多数探索算法在不确定性被解决之前都广泛搜索。当行动空间太大以至于在预算内无法解决时,实践者会默认采用 -贪婪策略,这会限制干扰,但盲目地覆盖了其覆盖范围。我们引入了“愉悦门控探索”(Delight-gated exploration, DE),这是一种主机-覆盖规则,仅在其前景愉悦值(预期改进乘以惊讶值)超过门槛价格时,才花费探索性动作。这种实用启发式方法恢复了一个古老结果:潘多拉的保留价值规则用于成本为零的搜索,其中惊讶值设置有效的检查成本。已解决的臂位于门户内,新臂位于超过先前确定阈值后关闭,所选线性-bandit 覆盖消耗有限的信息预算。在伯努利 bandit、线性 bandit 和表格 MDP 中,相同的超参数无需重新调整即可传递,而 DE 在所测试的未解决情境下比 Thompson 抽样和 -贪婪方法表现出 much weaker 的后悔增长。愉悦改进了行动,就像它改进了学习一样:它以愉悦值和惊讶值的乘积来定价稀缺资源。
引用
@article{arxiv.2605.13287,
title = {Delightful Exploration},
author = {Ian Osband},
journal= {arXiv preprint arXiv:2605.13287},
year = {2026}
}