中文

基于语言引导的可组合因果组件建模:强化学习中的未知环境建模

人工智能 2025-05-14 v1

摘要

在强化学习(RL)中,尤其是在智能体遇到具有未知动力学的新环境时,泛化仍然是一个重要挑战。我们借鉴了人类组合推理的思路——即通过重新配置已知组件来处理新情境——引入了世界建模的可组合因果组件(World Modeling with Compositional Causal Components, WM3C)框架。该新框架通过学习和利用可组合的因果组件来增强 RL 的泛化能力。与之前关注不变表示学习或元学习的方法不同,WM3C 识别并利用可组合元素的因果动力学,促进对新任务的稳健适应。我们的 метод将语言作为一种组合模式态,将潜在空间分解为有意义的组件,并在轻度假设下提供其唯一识别的理论保证。我们的实际实现使用带有互信息约束和自适应稀疏正则化的掩码自编码器来捕获高层语义信息,从而有效地解耦转移动力学。在数值仿真和真实世界机器人操作任务上的实验表明,WM3C 在识别潜在过程、改进策略学习和泛化到未知任务方面显著优于现有方法。

关键词

引用

@article{arxiv.2505.08361,
  title  = {Modeling Unseen Environments with Language-guided Composable Causal Components in Reinforcement Learning},
  author = {Xinyue Wang and Biwei Huang},
  journal= {arXiv preprint arXiv:2505.08361},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025