中文

文本到决策智能体:基于自然语言监督的离线元强化学习

人工智能 2025-11-25 v5

摘要

离线元强化学习通常通过推断高质量样本或热身探索来推断任务信念,以实现泛化。但受限形式限制了其通用性和可用性,因为这些监督信号在面对未见任务时昂贵且甚至难以获取。直接从决策任务的原始文本中学习是一个可利用更广泛监督来源的有前景的替代方案。本文提出了文本到决策智能体(T2DA),一个简单且可扩展的框架,通过自然语言监督离线元强化学习。我们首先引入通用世界模型,将多任务决策数据编码到动态感知的嵌入空间中。随后,受到CLIP启发,我们预测哪个文本描述与哪个决策嵌入相匹配,通过对比语言-决策预训练有效地桥接了它们之间的语义差距,并将文本嵌入对齐以理解环境动态。训练完文本条件通用策略后,智能体即可直接实现零样本文本到决策生成,以响应语言指令。在MuJoCo和Meta-World基准测试中的全面实验表明,T2DA实现了高容量的零样本泛化,并优于各种基线方法。我们的代码已在GitHub上公开:https://github.com/NJU-RL/T2DA。

关键词

引用

@article{arxiv.2504.15046,
  title  = {Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision},
  author = {Shilin Zhang and Zican Hu and Wenhao Wu and Xinyi Xie and Jianxiang Tang and Chunlin Chen and Daoyi Dong and Yu Cheng and Zhenhong Sun and Zhi Wang},
  journal= {arXiv preprint arXiv:2504.15046},
  year   = {2025}
}

备注

32 pages, 8 figures