面向低空经济的 BeamVLM:基于视觉语言模型的生成式波束预测
网络与互联网体系结构
2026-02-27 v1 信息论
math.IT
摘要
对于低空经济 (LAE),在高灵活性无人机 (UAVs) 与地面基站之间进行快速且准确的波束预测至关重要,这确保了无缝覆盖和可靠通信。然而,现有基于深度学习的波束预测方法缺乏对动态环境的高层语义理解,导致泛化能力差。另一方面,基于大型语言模型 (LLM) 的方法展现了提升泛化性的前景,但通常缺乏丰富的环境感知,无法捕获精细的空间语义,进而难以实现精确的波束对准。为此,本文提出一种新型的端到端生成框架用于波束预测,称为 BeamVLM,將波束预测视为视觉问答任务,充分利用强大的现有视觉语言模型 (VLMs)。通过将原始视觉 patch 直接投影到语言域并恰当设计指令提示,BeamVLM 使 VLMs 能够联合推理 UAV 轨迹与环境背景。实验结果表明,所提方法在真实数据集上优于最先进方法,预测准确率显著提升,并在车联网-基础设施 (V2I) 波束预测等其他场景中展现出卓越的泛化能力。
引用
@article{arxiv.2602.19929,
title = {BeamVLM for Low-altitude Economy: Generative Beam Prediction via Vision-language Models},
author = {Chenran Kou and Changsheng You and Mingjiang Wu and Dingzhu Wen and Zezhong Zhang and Chengwen Xing},
journal= {arXiv preprint arXiv:2602.19929},
year = {2026}
}
备注
We propose a novel end-to-end generative framework for beam prediction by using vision-language models