Re:Frame——从联想记忆中检索经验
机器学习
2025-08-28 v1 人工智能
摘要
在收集大规模专家数据集不可行或不切实际时,离线强化学习(RL)通常需要处理次优数据。这一限制使得智能体难以泛化并实现高性能,因为它们必须主要从不完美或不一致的轨迹中学习。因此,一个核心挑战是如何在大量但质量较低的数据旁充分利用稀缺的专家演示。我们证明,即使加入极少量的专家经验,也能显著提升 RL 智能体的性能。我们提出了 Re:Frame(Retrieving Experience From Associative Memory,从联想记忆中检索经验),这是一个即插即用模块,通过一个由来自独立数据集的专家轨迹填充的小型外部联想记忆缓冲区(AMB)来增强标准的离线 RL 策略(如 Decision Transformer)。在低质量数据上训练期间,策略学习通过基于内容的关联从联想记忆缓冲区(AMB)中检索专家数据并将其整合到决策中;在评估时查询同一 AMB。这不需要环境交互,也不需要对骨干架构进行修改。在 D4RL MuJoCo 任务上,仅使用 60 条专家轨迹(占 6000 条轨迹数据集的 0.1%),Re:Frame 在四个设置中的三个中持续优于强大的 Decision Transformer 基线,增益高达 +10.7 归一化分。这些结果表明,Re:Frame 提供了一种简单且数据高效的方法来注入稀缺专家知识,并从低质量数据集中显著改进离线 RL。
引用
@article{arxiv.2508.19344,
title = {Re:Frame -- Retrieving Experience From Associative Memory},
author = {Daniil Zelezetsky and Egor Cherepanov and Alexey K. Kovalev and Aleksandr I. Panov},
journal= {arXiv preprint arXiv:2508.19344},
year = {2025}
}
备注
11 pages, 3 figures