基于同态状态编码的不可靠通信信道上的鲁棒远程强化学习
机器学习
2026-05-12 v2 信息论
多智能体系统
math.IT
摘要
传统的强化学习(RL)框架通常假设智能体能够即时感知底层马尔可夫过程的状态,然后作出相应的行动。如果智能体无法直接观测该过程,而是通过不可靠且可能延迟的信道接收状态更新,则可能被迫使用部分和间歇性的信息运作。近年来,提出了诸多学习架构来管理带有不完美或远程反馈的强化学习;然而,这些方法往往针对特定用例进行设计,计算和通信负担较大。为克服这些限制,我们提出一种新型学习架构,称为同态鲁棒远程强化学习(HR3L),它能够在不可靠通信信道上进行分布式RL代理训练,无需交换梯度信息。我们的实验结果表明,HR3L在样本效率方面显著优于最先进的方法,实现更快的训练并降低通信开销。此外,我们展示了HR3L能够适应各种场景,包括数据包丢失、延迟传输和带宽限制,几乎不出现显著性能下降。
引用
@article{arxiv.2508.07722,
title = {Robust Remote Reinforcement Learning over Unreliable Communication Channels using Homomorphic State Encoding},
author = {Pietro Talli and Federico Mason and Federico Chiariotti and Andrea Zanella},
journal= {arXiv preprint arXiv:2508.07722},
year = {2026}
}
备注
This manuscript is currently under revision