中文

行动胜于言语:马尔可夫决策过程中的速率-奖励权衡

信息论 2025-09-05 v3 math.IT

摘要

通信对决策系统的影响已在专用通信信道的假设下得到广泛研究。我们转而考虑通过行动进行通信,其中信息被嵌入到在马尔可夫决策过程(MDP)框架中与环境交互的智能体的行动中。我们将MDP环境概念化为一个有限状态信道(FSC),其中智能体的行动作为信道输入,而由另一个智能体(即接收方)观察到的MDP状态作为信道输出。在此,我们将环境视为一个通信信道,智能体通过其行动在该信道上进行通信,同时试图最大化其奖励。我们首先刻画了在无限时域范围内平均奖励与可靠通信速率之间的最优信息论权衡。然后,我们提出了一个新颖的框架来设计一种联合控制/编码策略,称为 Act2Comm,该策略将信息无缝嵌入到行动中。从通信的角度来看,Act2Comm 在输入-输出约束下充当了针对不可微FSC的基于学习的信道编码方案。从控制的角度来看,Act2Comm 学习了一个融合了通信能力的MDP策略,尽管这以牺牲部分控制性能为代价。总体而言,Act2Comm 在这种环境中有效地平衡了控制与通信的双重目标。实验结果验证了 Act2Comm 在维持一定控制性能水平的同时实现可靠通信的能力。

关键词

引用

@article{arxiv.2502.03335,
  title  = {Actions Speak Louder Than Words: Rate-Reward Trade-off in Markov Decision Processes},
  author = {Haotian Wu and Gongpu Chen and Deniz Gündüz},
  journal= {arXiv preprint arXiv:2502.03335},
  year   = {2025}
}