通过自回归特征和优势加权构建更精细的行为基础模型
机器学习
2024-12-06 v1
摘要
前向-后向表示 (FB) 是一个最近提出的框架 (Touati 等,2023;Touati 与 Ollivier,2021),用于训练旨在为给定强化学习 (RL) 环境中指定的任何新任务提供零样本高效策略的行为基础模型 (BFM),无需为每个新任务进行训练。本文针对 FB 模型训练的两个核心局限性进行了解决。首先,像所有后继特征基于的方法一样,FB 依赖于任务的线性编码:在测试时,每个新的奖励函数都在固定的预训练特征集合上线性投影。这限制了表征的表达性和任务表示的精确度。我们通过引入 FB 的自回归特征来打破线性局限,这使得细粒度任务特征依赖于较粗粒度任务信息,从而可以表示任意非线性任务编码,从而显著增加了 FB 框架的表达性。其次,众所周知,从离线数据集训练 RL 代理通常需要特定技术。我们表明,FB 与此类离线 RL 技术效果良好,通过适应 (Nair 等,2020b;Cetin 等,2024) 的技术为 FB 所需,这是为了获得某些数据集(如 DMC Humanoid)的非平坦性能。结果是,我们为多个新环境生产了高效的 FB BFMs。值得注意的是,在 D4RL locomotion 基准测试中,通用 FB 代理匹配了标准单任务离线代理 (IQL, XQL) 的性能。在许多设置中,离线技术是获得任何可接受性能所必需的。自回归特征对任务需求空间精度和训练集之外的任务泛化具有积极但适度的影响。
引用
@article{arxiv.2412.04368,
title = {Finer Behavioral Foundation Models via Auto-Regressive Features and Advantage Weighting},
author = {Edoardo Cetin and Ahmed Touati and Yann Ollivier},
journal= {arXiv preprint arXiv:2412.04368},
year = {2024}
}