中文

通过全局工作空间实现强化学习策略的零样本跨模态迁移

人工智能 2025-06-05 v2

摘要

人类通过多种感官感知世界,使其能够创建对周围环境的全面表征并跨领域泛化信息。例如,当给定场景的文本描述时,人类可以在脑海中将其可视化。在机器人和强化学习(RL)等领域,智能体也可以通过多种传感器获取环境信息;然而,传感器之间的冗余性和互补性难以作为鲁棒性(例如抵御传感器故障)或泛化性(例如跨领域迁移)的来源加以利用。先前的研究表明,基于认知科学中“全局工作空间”的概念,可以高效构建鲁棒且灵活的多模态表征:这是一种训练用于跨模态组合信息并将其信号广播回每个模态的独特表征。在此,我们探索这种受大脑启发的多模态表征是否对RL智能体有益。首先,我们训练一个“全局工作空间”来利用通过两种输入模态(视觉输入,或代表智能体状态和/或其环境的属性向量)收集的环境信息。然后,我们使用这个冻结的全局工作空间训练RL智能体策略。在两个不同的环境和任务中,我们的结果揭示了模型在输入模态之间执行零样本跨模态迁移的能力,即将先前在属性向量上训练的策略应用于图像输入(反之亦然),而无需额外的训练或微调。完整全局工作空间的变体和消融实验(包括通过对比学习训练的类CLIP多模态表征)并未展现出相同的泛化能力。

关键词

引用

@article{arxiv.2403.04588,
  title  = {Zero-shot cross-modal transfer of Reinforcement Learning policies through a Global Workspace},
  author = {Léopold Maytié and Benjamin Devillers and Alexandre Arnold and Rufin VanRullen},
  journal= {arXiv preprint arXiv:2403.04588},
  year   = {2025}
}