中文

基于强化学习的视觉 grounded 概念的组合式学习

机器学习 2024-05-06 v2 人工智能

摘要

儿童能够将组合构造的规则快速泛化到未见的测试集。另一方面,深度强化学习(RL)智能体需要经历数百万轮训练才能学习,且其泛化到未见组合的能力仍不明确。因此,我们利用在合成三维环境中导航至指定颜色-形状目标这一任务,研究 RL 智能体的组合能力。首先,我们表明,当 RL 智能体被朴素地训练以导航至目标颜色-形状组合时,它们隐式地学习分解这些组合,使其能够将之(重新)组合并在留出测试组合上取得成功(“组合式学习”)。其次,当智能体被预训练以学习不变的形状与颜色概念(“概念学习”)时,随后进行组合式学习所需的轮数减少了 20 倍。此外,只有在概念学习与组合式学习上都训练过的智能体才能以零样本方式解决更复杂的、分布外环境。最后,我们验证了只有基于图像-文本数据集(如 CLIP)预训练的文本编码器减少了我们的智能体展现组合式学习所需的训练轮数,并且也能以零样本方式泛化到 5 种未见颜色。总体而言,我们的结果首次证明 RL 智能体可以被训练以隐式学习概念与组合性,从而以零样本方式解决更复杂的环境。

关键词

引用

@article{arxiv.2309.04504,
  title  = {Compositional Learning of Visually-Grounded Concepts Using Reinforcement},
  author = {Zijun Lin and Haidi Azaman and M Ganesh Kumar and Cheston Tan},
  journal= {arXiv preprint arXiv:2309.04504},
  year   = {2024}
}