通过受约束多目标深度强化学习联合优化边缘学习中的训练与推理
机器学习
2026-05-26 v1 分布式、并行与集群计算
网络与互联网体系结构
摘要
联邦边缘学习 (FEEL) 最近涌现为通过在边缘设备上实现协作模型训练来实现边缘智能 (EI) 的有前景的范式。 本文我们提出一种在资源受限的边缘设备上联合管理联邦训练和推理的在线优化框架。 我们引入一种仿照 tandem-queue 的转换机制,将推理请求与训练数据相连接,并进一步纳入数据和模型的新鲜度以捕捉现实环境中的时序动态。 为在最大化推理精度的同时最小化延迟和能耗,边缘设备的模式选择、通信和计算资源分配被联合优化。 我们将该优化表述为多目标优化问题,为 NP-hard 并进一步受到在线设置的复杂化。 为应对这些挑战,我们将问题转化为多目标马尔可夫决策过程 (MOMDP),并开发一种受约束多目标近端策略优化 (C-MOPPO) 算法。 具体而言,C-MOPPO 首先学习一组在三个目标上具有不同偏好 Preferences 的策略,然后利用受约束策略优化来丰富 Pareto 前沿并获得高质量、稠密解。 大量实验表明,C-MOPPO 在 various system configurations 下实现了目标之间的良好均衡权衡,并显著优于基线方法。
引用
@article{arxiv.2605.25916,
title = {Joint Optimization of Training and Inference in Federated Edge Learning via Constrained Multi-Objective Deep Reinforcement Learning},
author = {Zhen Li and Jun Cai and Chao Yang and Haoran Gao},
journal= {arXiv preprint arXiv:2605.25916},
year = {2026}
}