面向组合式世界模型的神经符号接地
机器学习
2024-05-13 v2 人工智能
机器学习
摘要
我们引入 Cosmos,一个以对象为中心的世界建模框架,专为组合泛化(CompGen)而设计,即在由已知视觉“原子”组合得到的未见输入场景上实现高性能。Cosmos 的核心洞见是使用一种新颖形式的神经符号接地。具体而言,该框架引入了两个新工具:(i)神经符号场景编码,其使用神经编码器计算的实向量以及描述实体属性的可组合符号向量来表示场景中的每个实体;(ii)一种神经符号注意力机制,将这些实体绑定到习得的交互规则。Cosmos 是端到端可微分的;此外,不同于需要手动将表示映射到符号的传统神经符号方法,它使用视觉-语言基础模型计算实体的符号属性。通过在已建立的方块推动领域上考虑两种不同形式的 CompGen 的评估,我们表明该框架在世界建模的 CompGen 方面确立了新的最先进水平(SOTA)。相关资源见:https://trishullab.github.io/cosmos-web/
引用
@article{arxiv.2310.12690,
title = {Neurosymbolic Grounding for Compositional World Models},
author = {Atharva Sehgal and Arya Grayeli and Jennifer J. Sun and Swarat Chaudhuri},
journal= {arXiv preprint arXiv:2310.12690},
year = {2024}
}
备注
Uploading ICLR,2024 Camera Ready Version