大语言模型赋能的无人机数据收集决策变换器
系统与控制
2025-09-23 v2 机器学习
系统与控制
摘要
部署无人机(UAV)进行可靠且节能的空间分布设备数据收集具有广阔前景,能够支持多样化的物联网(IoT)应用。然而,UAV 的有限续航和通信范围 necessitate 对其进行智能轨迹规划。虽然强化学习(RL)已被广泛用于 UAV 轨迹优化,但其交互性质在实际环境中意味着高成本和风险。离线 RL 虽能缓解这些问题,但仍易受不稳定训练和高度依赖专家质量数据集的限制。为此,我们构建了联合 UAV 轨迹规划和资源分配问题,以最大化数据收集能源效率。首先,将资源分配子问题转化为等价线性规划形式并以多项式时间复杂度求解。随后,我们提出一种大语言模型(LLM)赋能的批评正则化决策变换器(DT)框架,称为 LLM-CRDT,用于学习有效的 UAV 控制策略。在 LLM-CRDT 中,我们引入批评网络来正则化 DT 模型训练,从而将 DT 的序列建模能力与批评基于价值导师结合起来,以从次优数据集中学习有效策略。此外,为缓解变换器模型的数据稀缺性,我们采用预训练的 LLM 作为 DT 模型的变换器骨干,并采用参数高效微调策略(即 LoRA),使其能够在小规模数据集和低计算开销下快速适应 UAV 控制任务。广泛的仿真实验表明,LLM-CRDT 在能源效率方面优于基准在线和离线 RL 方法,比当前最先进的 DT 方法高出最高 36.7%。
引用
@article{arxiv.2509.13934,
title = {Large Language Model-Empowered Decision Transformer for UAV-Enabled Data Collection},
author = {Zhixion Chen and Jiangzhou Wang and Hyundong Shin and Arumugam Nallanathan},
journal= {arXiv preprint arXiv:2509.13934},
year = {2025}
}
备注
14pages, 8 figures