Swift-Sarsa:快速且鲁棒的线性控制
机器学习
2025-07-29 v1 人工智能
机器学习
摘要
Javed、Sharifnassab和Sutton(2024)引入了一种用于TD学习的新算法——SwiftTD,它通过步长优化、有效学习率界限和步长衰减来增强True Online TD()。在他们的实验中,SwiftTD在源自Atari游戏的各种预测任务上优于True Online TD()和TD(),并且其性能对超参数的选择具有鲁棒性。在本扩展摘要中,我们将SwiftTD扩展以适用于控制问题。我们将SwiftTD背后的关键思想与True Online Sarsa()相结合,开发了一种称为的同策略强化学习算法。我们提出了一个用于线性同策略控制的简单基准,称为。操作性条件反射基准中的关键挑战是,输入信号中只有极小一部分与决策相关。大部分信号是从非平稳分布中采样的噪声。为了有效学习,智能体必须学会区分相关信号和噪声信号,并通过将信用分配给与相关信号关联的权重参数来最小化预测误差。Swift-Sarsa应用于操作性条件反射基准时,在没有任何关于问题结构的先验知识的情况下,学会了将信用分配给相关信号。它为通过并行搜索数亿个特征来学习表示的解决方法打开了大门,且不会因噪声或不良特征而导致性能下降。
引用
@article{arxiv.2507.19539,
title = {Swift-Sarsa: Fast and Robust Linear Control},
author = {Khurram Javed and Richard S. Sutton},
journal= {arXiv preprint arXiv:2507.19539},
year = {2025}
}
备注
Presented at RLDM 2025