中文

基于同态状态编码的不可靠通信信道上的鲁棒远程强化学习

机器学习 2026-05-12 v2 信息论 多智能体系统 math.IT

摘要

传统的强化学习(RL)框架通常假设智能体能够即时感知底层马尔可夫过程的状态,然后作出相应的行动。如果智能体无法直接观测该过程,而是通过不可靠且可能延迟的信道接收状态更新,则可能被迫使用部分和间歇性的信息运作。近年来,提出了诸多学习架构来管理带有不完美或远程反馈的强化学习;然而,这些方法往往针对特定用例进行设计,计算和通信负担较大。为克服这些限制,我们提出一种新型学习架构,称为同态鲁棒远程强化学习(HR3L),它能够在不可靠通信信道上进行分布式RL代理训练,无需交换梯度信息。我们的实验结果表明,HR3L在样本效率方面显著优于最先进的方法,实现更快的训练并降低通信开销。此外,我们展示了HR3L能够适应各种场景,包括数据包丢失、延迟传输和带宽限制,几乎不出现显著性能下降。

关键词

引用

@article{arxiv.2508.07722,
  title  = {Robust Remote Reinforcement Learning over Unreliable Communication Channels using Homomorphic State Encoding},
  author = {Pietro Talli and Federico Mason and Federico Chiariotti and Andrea Zanella},
  journal= {arXiv preprint arXiv:2508.07722},
  year   = {2026}
}

备注

This manuscript is currently under revision