通过正确的因果世界模型做出更好的决策
人工智能
2025-04-11 v1 机器学习
摘要
强化学习(RL)代理在各种环境中表现出色,能够直接从感官输入中发现有效策略。然而,这些代理经常利用训练数据中的虚假相关性,导致行为脆弱,无法泛化到新的或略有变化的环境。为了解决这个问题,我们引入了因果对象中心模型提取工具(COMET),这是一种新颖的算法,旨在学习精确的可解释因果世界模型(CWM)。COMET首先从观测中提取对象中心状态描述,并识别与所描绘对象属性相关的环境内部状态。使用符号回归,它对对象中心转换进行建模,并推导出控制对象动态的因果关系。COMET进一步结合大语言模型(LLM)进行语义推理,注释因果变量以增强可解释性。通过利用这些能力,COMET构建了与环境真实因果结构一致的CWM,使代理能够专注于任务相关特征。提取的CWM减轻了捷径的危险,允许开发能够在动态场景中更好规划和决策的RL系统。我们在Atari环境(如Pong和Freeway)中验证的结果证明了COMET的准确性和鲁棒性,突显了其在强化学习中弥合对象中心推理与因果推断之间差距的潜力。
引用
@article{arxiv.2504.07257,
title = {Better Decisions through the Right Causal World Model},
author = {Elisabeth Dillies and Quentin Delfosse and Jannis Blüml and Raban Emunds and Florian Peter Busch and Kristian Kersting},
journal= {arXiv preprint arXiv:2504.07257},
year = {2025}
}
备注
5 pages including references, 2 figures