中文

以信念为导向的前向-后向探索

机器学习 2025-07-09 v1 人工智能

摘要

在缺乏具体奖励的情况下,零样量强化学习对于从未来问题设置中快速适应至关重要。前向-后向表示 (FB) 已成为一种通过对 policy occupancy measure 进行因式分解来学习最优 policy 的有前景的方法。然而,迄今为止,FB 以及许多类似的零样量强化学习算法都与探索问题脱节,通常依赖于其他探索算法进行数据收集。我们认为,FB 表示本质上应该用于探索以更高效地学习。为此目标,我们设计了一种自然从 FB 表示中产生的探索 policy,这些 policy 通过最小化 FB 表示的后验方差,从而最小化其信念不确定性。我们经验性地演示,这种原则性的探索策略显著改进了 FB algorithm 的样本复杂度,与其他探索方法相比效果更佳。代码已公开 available at https://sites.google.com/view/fbee-url。

关键词

引用

@article{arxiv.2507.05477,
  title  = {Epistemically-guided forward-backward exploration},
  author = {Núria Armengol Urpí and Marin Vlastelica and Georg Martius and Stelian Coros},
  journal= {arXiv preprint arXiv:2507.05477},
  year   = {2025}
}