中文

面向视觉语言模型的协同边缘到服务器推理

计算机视觉与模式识别 2025-12-19 v1 人工智能

摘要

我们提出了一种面向视觉语言模型(VLM)的协同边缘到服务器推理框架,通过减少通信成本来保持推理准确性。在典型部署中,边缘设备(客户端)上捕获的视觉数据被传输到服务器进行 VLM 推理。然而,通常会将原始图像(全局图像)调整以匹配视觉编码器的输入分辨率,这会丢弃细粒度细节,导致准确率下降。为克服这一限制,我们设计了一个两个阶段的框架。在第一个阶段,服务器对全局图像进行推理,并使用 VLM 的内部注意力识别感兴趣区域(RoI)。随后计算输出标记的最小熵,将其作为置信度 measure 来确定是否需要重传。如果最小熵超过预定义阈值,服务器会请求边缘设备发送保留细节的 RoI 的局部图像。服务器随后通过联合利用全局图像和局部图像来细化其推理。这种选择性重传策略确保仅传输essential视觉内容。跨多个 VLM 架构的实验表明,所提框架显著减少通信成本,同时保持推理准确性。

关键词

引用

@article{arxiv.2512.16349,
  title  = {Collaborative Edge-to-Server Inference for Vision-Language Models},
  author = {Soochang Song and Yongjune Kim},
  journal= {arXiv preprint arXiv:2512.16349},
  year   = {2025}
}

备注

13 pages, 12 figures