基于包络更新的通用多目标强化学习在URLLC支持的车联网络中的应用
机器学习
2025-06-17 v3 人工智能
网络与互联网体系结构
摘要
我们开发了一种新颖的多目标强化学习(MORL)框架,用于在采用常规亚6GHz频谱和太赫兹频率的多频段车联网络中联合优化无线网络选择和自动驾驶策略。该框架旨在:1. 通过控制车辆运动动力学(即速度和加速度)来最大化交通流量并最小化碰撞;2. 在最小化跳变(HO)的同时提升超可靠低时延通信(URLLC)。我们将此问题建模为多目标马尔可夫决策过程(MOMDP),并为目标冲突的预定义和未知偏好提供解决方案。具体而言,我们开发了一种新颖的包络MORL解决方案,通过开发针对代理的多目标策略来解决多个具有未知偏好的目标。虽然该方法减少了对标量奖励的依赖,但策略在不同偏好下有效性是一个挑战。为此,我们应用了广义的贝尔曼方程,并优化多目标Q值的凸包,以学习一种能够生成所有可能偏好配置下最优策略的统一参数表示。学习初始阶段后,我们的智能体可以在指定偏好下执行最优策略,或从最小数据样本中推断偏好。数值结果验证了基于包络的MORL解决方案的有效性,并揭示了车辆运动动力学、跳变和通信数据速率之间的相互依赖性。该方案使自动驾驶车辆能够采取安全驾驶行为并提升连接性。
引用
@article{arxiv.2405.11331,
title = {Generalized Multi-Objective Reinforcement Learning with Envelope Updates in URLLC-enabled Vehicular Networks},
author = {Zijiang Yan and Hina Tabassum},
journal= {arXiv preprint arXiv:2405.11331},
year = {2025}
}
备注
Accepted in IEEE Transactions on Vehicular Technology