中文

CIG:基于条件信息增益的探索

机器学习 2026-05-21 v1

摘要

在强化学习中,内在奖励通常基于不同情境进行条件化:终生奖励对每一步转移都基于累积经验打分,但忽略 rollout 内的冗余;episodic奖励惩罚轨迹内的重复,但丢弃生命周期的进展。混合方法通过启发式权重合并两种信号,或要求高斯过程动态模型,后者难以扩展到高维状态空间。轨迹级别的信息增益分解为条件于回放缓冲区和 rollout 前缀的逐步项,但对深度模型而言仍不可计算。我们推导条件信息增益(CIG)奖励作为可计算替代方案:基于ensemble disagreement kernel的对数行列式目标,其Cholesky分解产生保留两种条件化集合的因果逐步奖励,从而扩展至高维状态空间。我们在基于模型的设置中实现CIG,其中rollout较短且在rollout内的纠正尚未充分探索。在12项任务中(涵盖离散MiniGrid和连续控制OGBench),在干净和随机干扰设置下,CIG在保持鲁性的同时,优于或相当于先前的探索方法。

关键词

引用

@article{arxiv.2605.20878,
  title  = {CIG: Exploration via Conditional Information Gain},
  author = {Tim Joseph and Marcus Fechner and Philipp Stegmaier and Karam Daaboul and J. Marius Zöllner},
  journal= {arXiv preprint arXiv:2605.20878},
  year   = {2026}
}

备注

28 pages, 10 figures, 3 tables