基于视觉转换器的用户设备定位
计算机视觉与模式识别
2025-11-12 v1 网络与互联网体系结构
摘要
最近,深度学习技术被用于用户设备(UE)定位。然而,这些模型的关键短板在于:i)它们对整个输入赋予相同的注意力;ii)它们不太适用于非序列数据,例如仅提供瞬时信道状态信息(CSI)时。在此背景下,我们提出了一种基于注意力的视觉转换器(ViT)架构,专注于从信道状态矩阵中提取的角延迟轮廓(ADP)。我们的方法在`DeepMIMO'和`ViWi'射线追踪数据集上进行验证,分别在室内达到0.55米的均方根误差(RMSE),在DeepMIMO户外达到13.59米,在ViWi户外阻塞场景中达到3.45米。该方案在SOTA方法上实现约38%的性能提升。它在误差距离分布方面也显著优于我们所考虑的其他方法。
引用
@article{arxiv.2511.08549,
title = {Vision Transformer Based User Equipment Positioning},
author = {Parshwa Shah and Dhaval K. Patel and Brijesh Soni and Miguel López-Benítez and Siddhartan Govindasamy},
journal= {arXiv preprint arXiv:2511.08549},
year = {2025}
}
备注
The results are accepted in parts at IEEE CCNC2026