基于语言编码门控策略网络的多任务强化学习
机器学习
2025-10-08 v1 人工智能
摘要
多任务强化学习通常依赖于任务元数据——如简短的自然语言描述——以引导跨越多样化目标的行为。我们提出Lexical Policy Networks (LEXPOL),一种用于多任务强化学习的语言条件化混合策略架构。LEXPOL使用文本编码器编码任务元数据,并使用学习型门控模块选择或混合多个子策略,从而实现跨任务的端到端训练。在MetaWorld基准测试上,LEXPOL在成功率和样本效率方面与或超过强大的多任务基线,无需任务特定的重新训练。为分析该机制,我们进一步研究了固定专家策略的设置,这些专家策略独立于门控器获得。我们表明,学习型语言门控能够组合这些专家,以产生适用于新任务描述和不可见任务组合的行为。这些结果表明,自然语言元数据能够有效索引并在单个策略中重用技能。
引用
@article{arxiv.2510.06138,
title = {Multi-Task Reinforcement Learning with Language-Encoded Gated Policy Networks},
author = {Rushiv Arora},
journal= {arXiv preprint arXiv:2510.06138},
year = {2025}
}
备注
14 pages, 3 figures, 12 tables, 2 appendices. Currently under review