协作通信中的语义年龄:通过离线强化学习加速从仿真到现实的迁移
人工智能
2022-09-20 v1 机器学习
摘要
信息年龄度量无法正确描述状态更新的内在语义。在智能反射面辅助的协作中继通信系统中,我们提出语义年龄(AoS)用于度量状态更新的语义新鲜度。具体地,我们关注从源节点(SN)到目的地的状态更新,将其建模为马尔可夫决策过程(MDP)。SN 的目标是在最大发射功率约束下最大化 AoS 期望满意度和能耗的期望满意度。为寻求最优控制策略,我们首先在策略内时序差分学习框架下推导了一种在线深度 actor-critic(DAC)学习方案。然而,在线 DAC 的实际部署面临 SN 与系统之间无限重复交互的关键挑战,这在探索阶段尤其危险。我们随后提出了一种新颖的离线 DAC 方案,该方案从先前收集的数据集中估计最优控制策略,而无需与系统有任何进一步交互。数值实验验证了理论结果,并表明我们的离线 DAC 方案在平均效用方面显著优于在线 DAC 方案和最具代表性的基线,展现出对数据集质量的强鲁棒性。
引用
@article{arxiv.2209.08947,
title = {Age of Semantics in Cooperative Communications: To Expedite Simulation Towards Real via Offline Reinforcement Learning},
author = {Xianfu Chen and Zhifeng Zhao and Shiwen Mao and Celimuge Wu and Honggang Zhang and Mehdi Bennis},
journal= {arXiv preprint arXiv:2209.08947},
year = {2022}
}
备注
This work has been submitted to the IEEE for possible publication