中文

基于 Koopman 算子的深度强化学习泛化方法及其在无线通信中的应用

机器学习 2025-07-31 v2 信息论 math.IT

摘要

深度强化学习(DRL)是推动各科学和工程领域(包括无线通信)进步的关键机器学习技术。然而,其有限的解释性和泛化能力仍然是主要挑战。在监督学习中,泛化能力通常通过基于信息论方法的泛化误差来评估。在 DRL 中,训练数据是序列化的且不满足独立同分布(i.i.d.)假设,这使得传统的信息论方法不适合泛化分析。为应对这一挑战,本文提出了一种用于评估 DRL 泛化能力的新型分析方法。具体而言,我们首先将训练好的 DRL 算法中的状态和动作演化建模为未知的离散、随机和非线性动态函数。然后,我们采用数据驱动的识别方法——Koopman 算子来逼近这些函数,并提出两种可解释的表示。基于这些可解释的表示,我们开发了一种严格的数学方法来评估 DRL 算法的泛化能力。该方法利用 Koopman 算子的谱特征分析,并借助 H∞ 范数来表述。最后,我们将这种泛化分析方法应用于比较广泛认可的鲁棒 DRL 方法——软演员-评论家(soft actor-critic)方法与近端策略优化(proximal policy optimization)算法在无人机辅助毫米波无线通信场景中的表现。

关键词

引用

@article{arxiv.2503.02961,
  title  = {Koopman-Based Generalization of Deep Reinforcement Learning With Application to Wireless Communications},
  author = {Atefeh Termehchi and Ekram Hossain and Isaac Woungang},
  journal= {arXiv preprint arXiv:2503.02961},
  year   = {2025}
}