中文

AXIOM:基于可扩展以对象为中心的模型在数分钟内学会玩游戏

人工智能 2025-06-02 v1 机器学习 机器学习

摘要

当前的深度强化学习(DRL)方法在各个领域取得了最先进的性能,但与人类学习相比,在数据效率方面存在困难,而人类学习利用了关于物体及其交互的核心先验。主动推理提供了一个原则性框架,将感官信息与先验知识相结合以学习世界模型,并量化其自身信念和预测的不确定性。然而,主动推理模型通常是为单一任务定制的,缺乏 DRL 方法典型的领域灵活性。为弥合这一差距,我们提出了一种新颖的架构,该架构整合了一组最小但富有表达力的关于以对象为中心的动态和交互的核心先验,以加速低数据环境下的学习。我们将由此产生的方法称为 AXIOM,它结合了贝叶斯方法通常的数据效率和可解释性,以及通常与 DRL 相关的跨任务泛化能力。AXIOM 将场景表示为物体的组合,其动态被建模为分段线性轨迹,以捕捉稀疏的物体间交互。生成模型的结构通过从单一事件中增长和学习混合模型而在线扩展,并通过贝叶斯模型约简进行周期性细化以诱导泛化。AXIOM 仅需 10,000 次交互步骤即可掌握各种游戏,与 DRL 相比参数数量更少,且无需基于梯度的优化的计算开销。

关键词

引用

@article{arxiv.2505.24784,
  title  = {AXIOM: Learning to Play Games in Minutes with Expanding Object-Centric Models},
  author = {Conor Heins and Toon Van de Maele and Alexander Tschantz and Hampus Linander and Dimitrije Markovic and Tommaso Salvatori and Corrado Pezzato and Ozan Catal and Ran Wei and Magnus Koudahl and Marco Perin and Karl Friston and Tim Verbelen and Christopher Buckley},
  journal= {arXiv preprint arXiv:2505.24784},
  year   = {2025}
}

备注

10 pages main text, 4 figures, 2 tables; 25 pages supplementary material, 8 figures