中文

基于语言编码门控策略网络的多任务强化学习

机器学习 2025-10-08 v1 人工智能

摘要

多任务强化学习通常依赖于任务元数据——如简短的自然语言描述——以引导跨越多样化目标的行为。我们提出Lexical Policy Networks (LEXPOL),一种用于多任务强化学习的语言条件化混合策略架构。LEXPOL使用文本编码器编码任务元数据,并使用学习型门控模块选择或混合多个子策略,从而实现跨任务的端到端训练。在MetaWorld基准测试上,LEXPOL在成功率和样本效率方面与或超过强大的多任务基线,无需任务特定的重新训练。为分析该机制,我们进一步研究了固定专家策略的设置,这些专家策略独立于门控器获得。我们表明,学习型语言门控能够组合这些专家,以产生适用于新任务描述和不可见任务组合的行为。这些结果表明,自然语言元数据能够有效索引并在单个策略中重用技能。

关键词

引用

@article{arxiv.2510.06138,
  title  = {Multi-Task Reinforcement Learning with Language-Encoded Gated Policy Networks},
  author = {Rushiv Arora},
  journal= {arXiv preprint arXiv:2510.06138},
  year   = {2025}
}

备注

14 pages, 3 figures, 12 tables, 2 appendices. Currently under review