中文

组合预训练模型以增强强化学习中的特征表示

机器学习 2025-07-11 v1 人工智能

摘要

近期关注和发布的预训练模型是众多领域(如自然语言处理和计算机视觉)取得进展的关键因素,事实上,预训练模型学习到的离散潜在嵌入共享着有洞察的表示。另一方面,强化学习(RL)聚焦于通过智能体与环境交互获取累积奖励。RL 智能体 lacks 关于世界的先验知识,它们要么从零开始学习 observation 与 action 空间之间的 end-to-end 映射,要么在更近期的工作中与计算昂贵的 Foundational Models 配对。如何有效地同时利用不同预训练模型隐藏的有限信息仍是一个悬而未决且缺乏研究的问题。本文提出了 Weight Sharing Attention(WSA),一种新型架构用于组合多个预训练模型的嵌入,以塑造增强的状态表示,在效率与性能之间进行权衡。我们对几种组合模式进行了广泛比较,表明 WSA 在多个 Atari 游戏上获得的性能与 end-to-end 模型相当。此外,我们研究了该方法的泛化能力,分析了增加模型数量如何影响智能体在训练期间及训练后性能。

关键词

引用

@article{arxiv.2507.07197,
  title  = {Combining Pre-Trained Models for Enhanced Feature Representation in Reinforcement Learning},
  author = {Elia Piccoli and Malio Li and Giacomo Carfì and Vincenzo Lomonaco and Davide Bacciu},
  journal= {arXiv preprint arXiv:2507.07197},
  year   = {2025}
}

备注

Published at 4th Conference on Lifelong Learning Agents (CoLLAs), 2025