PoliFormer:以 Transformer 实现规模化的在-policy 强化学习,培养出卓越的导航智能体
机器人学
2024-07-01 v1 计算机视觉与模式识别
摘要
我们提出了 PoliFormer(Policy Transformer),一个仅使用 RGB 信息的室内导航智能体,通过规模化的强化学习在仿真环境中进行端到端训练,能够在无需适配的情况下泛化到真实世界。PoliFormer 使用基础视觉 Transformer 编码器配合因果 Transformer 解码器,实现长期记忆与推理。它跨越多个环境进行数亿次交互的训练,利用并行的多机器 rollout 实现高吞吐量的训练。PoliFormer 是一个出色的导航者, 在两个不同的 embodiment——LoCoBot 和 Stretch RE-1 机器人上,以及四个导航基准测试中均取得了最先进的成绩。它突破了前任工作的瓶颈,在 CHORES-S 基准测试的对象目标导航中实现了 unprecedented 的 85.5% 成功率,提升了 28.5%。PoliFormer 还可以轻松扩展到各种下游应用,如目标跟踪、多目标导航和开放词汇导航,且无需微调。
引用
@article{arxiv.2406.20083,
title = {PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators},
author = {Kuo-Hao Zeng and Zichen Zhang and Kiana Ehsani and Rose Hendrix and Jordi Salvador and Alvaro Herrasti and Ross Girshick and Aniruddha Kembhavi and Luca Weihs},
journal= {arXiv preprint arXiv:2406.20083},
year = {2024}
}