中文

Swift-Sarsa:快速且鲁棒的线性控制

机器学习 2025-07-29 v1 人工智能 机器学习

摘要

Javed、Sharifnassab和Sutton(2024)引入了一种用于TD学习的新算法——SwiftTD,它通过步长优化、有效学习率界限和步长衰减来增强True Online TD(λ\lambda)。在他们的实验中,SwiftTD在源自Atari游戏的各种预测任务上优于True Online TD(λ\lambda)和TD(λ\lambda),并且其性能对超参数的选择具有鲁棒性。在本扩展摘要中,我们将SwiftTD扩展以适用于控制问题。我们将SwiftTD背后的关键思想与True Online Sarsa(λ\lambda)相结合,开发了一种称为Swift-Sarsa\textit{Swift-Sarsa}的同策略强化学习算法。我们提出了一个用于线性同策略控制的简单基准,称为操作性条件反射基准\textit{操作性条件反射基准}。操作性条件反射基准中的关键挑战是,输入信号中只有极小一部分与决策相关。大部分信号是从非平稳分布中采样的噪声。为了有效学习,智能体必须学会区分相关信号和噪声信号,并通过将信用分配给与相关信号关联的权重参数来最小化预测误差。Swift-Sarsa应用于操作性条件反射基准时,在没有任何关于问题结构的先验知识的情况下,学会了将信用分配给相关信号。它为通过并行搜索数亿个特征来学习表示的解决方法打开了大门,且不会因噪声或不良特征而导致性能下降。

关键词

引用

@article{arxiv.2507.19539,
  title  = {Swift-Sarsa: Fast and Robust Linear Control},
  author = {Khurram Javed and Richard S. Sutton},
  journal= {arXiv preprint arXiv:2507.19539},
  year   = {2025}
}

备注

Presented at RLDM 2025