中文

传感器故障时:鲁棒 PPO 的时序序列模型

机器学习 2026-03-25 v2 人工智能

摘要

实际的强化学习系统必须在其观测流中处理分布漂移,但大多数策略架构默认假设完全观测且无噪声的状态。我们研究在持续性传感器故障导致部分可观测性和表示漂移的情况下,Proximal Policy Optimization (PPO) 的鲁棒性。为响应这种漂移,我们增强 PPO 使用时序序列模型,包括 Transformer 和状态空间模型 (SSM),以使策略能够从历史中推断缺失信息并维持性能。在随机传感器故障过程中,我们给出了对无限视角奖励降解的高概率界限,量化了鲁棒性如何依赖于策略光滑性和故障持续性。经验上,在 MuJoCo 持续控制基准测试上进行严重传感器丢弃测试,我们展示 Transformer 基于时序序列的策略在鲁棒性上显著优于 MLP、RNN 和 SSM 基线,能够在大量传感器不可用时保持高回报。这些结果表明,时序序列推理为可靠地在由传感器不可靠性导致的观测漂移下运行提供了原则且实用的机制。

关键词

引用

@article{arxiv.2603.04648,
  title  = {When Sensors Fail: Temporal Sequence Models for Robust PPO under Sensor Drift},
  author = {Kevin Vogt-Lowell and Theodoros Tsiligkaridis and Rodney Lafuente-Mercado and Surabhi Ghatti and Shanghua Gao and Marinka Zitnik and Daniela Rus},
  journal= {arXiv preprint arXiv:2603.04648},
  year   = {2026}
}

备注

Accepted at ICLR 2026 CAO Workshop