中文

策略感知的惊喜(SuS)用于内在探索

机器学习 2026-01-16 v1 人工智能 计算与语言 计算机科学与博弈论

摘要

我们提出了策略感知惊喜(Strategy-aware Surprise, SuS),这是一种新的内在动机框架,利用前后预测之间的偏差作为探索的新颖信号。在强化学习中,传统的好奇驱动方法仅依赖状态预测误差,而 SuS 引入了两个互补组件:策略稳定性(Strategy Stability, SS)和策略惊喜(Strategy Surprise, SuS)。SS 测量行为策略在时间步骤之间的一致性,而 SuS 捕捉相对于代理当前策略表示的意外结果。我们的组合奖励公式通过学习到的权重系数利用这两个信号。我们在数学推理任务上使用大型语言模型进行评估,展示了在准确率和解题多样性方面的显著提升。消融研究表明,移除任一组件都会导致至少 10% 的性能下降,验证了我们方法的协同性。与基线方法相比,SuS 在 Pass@1 上实现了 17.4% 的提升,在 Pass@5 上实现了 26.4% 的提升,同时在训练过程中保持更高的策略多样性。

关键词

引用

@article{arxiv.2601.10349,
  title  = {SuS: Strategy-aware Surprise for Intrinsic Exploration},
  author = {Mark Kashirskiy and Ilya Makarov},
  journal= {arXiv preprint arXiv:2601.10349},
  year   = {2026}
}

备注

8 pages, 7 figures, 3 tables. Code available at https://github.com/mariklolik/sus