车联网中非正交年龄最优信息分发:一种元多目标强化学习方法
机器学习
2024-02-20 v1
摘要
本文考虑在车联网中最小化信息年龄(AoI)和传输功耗,其中路侧单元(RSU)向车辆提供关于一组物理过程的及时更新。我们考虑基于 RSU 叠加消息传输和车辆处连续干扰消除(SIC)的非正交多模态信息分发。所构建的问题是一个多目标混合整数非线性规划问题,因此获得帕累托最优前沿极具挑战性。首先,我们利用加权和法将多目标问题分解为一组对应于每个预定义目标偏好权重的单目标子问题。然后,我们开发了一种混合深度 Q 网络(DQN)-深度确定性策略梯度(DDPG)模型,以针对每个预定义目标偏好权重求解相应的优化子问题。其中 DQN 优化解码顺序,而 DDPG 解决连续功率分配问题。该模型需要为每个子问题重新训练。随后,我们提出了一种两阶段元多目标强化学习解决方案,仅需少量微调更新步骤即可估计帕累托前沿,而无需为每个子问题重新训练模型。仿真结果表明,与现有基准相比,所提出的解决方案行之有效,且元多目标强化学习模型能以减少的训练时间估计出高质量的帕累托前沿。
引用
@article{arxiv.2402.12260,
title = {Non-orthogonal Age-Optimal Information Dissemination in Vehicular Networks: A Meta Multi-Objective Reinforcement Learning Approach},
author = {A. A. Habob and H. Tabassum and O. Waqar},
journal= {arXiv preprint arXiv:2402.12260},
year = {2024}
}