中文

GLIMPSE:面向可穿戴设备的实时文本识别与VQA情境理解

计算机视觉与模式识别 2026-02-17 v1 人机交互

摘要

视频大语言模型(Video LLM)在文本识别和基于文本的视觉问答(Text VQA)任务中取得了显著进展。然而,在可穿戴设备上部署 Text VQA 面临根本性矛盾:文本识别需要高分辨率视频,而高质量视频流会耗尽电池并导致热降频。此外,现有模型在实时处理文本跨多帧的语义上下文时难以保持一致性。我们观察到文本识别与视觉推理具有不同的分辨率需求——OCR 需要细节,场景理解可接受粗糙特征。我们采用混合架构,对局部高分辨率文本进行本地 OCR,同时以低分辨率视频流式传输用于视觉上下文。在覆盖五个任务类别的文本 VQA 测试集上,本系统在仅使用全分辨率流式传输能耗的 0.49 倍功耗下实现了 72% 的准确率,使可穿戴设备能够在不牺牲文本理解质量的前提下持续进行 VQA 会话。

关键词

引用

@article{arxiv.2602.13479,
  title  = {GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables},
  author = {Akhil Ramachandran and Ankit Arun and Ashish Shenoy and Abhay Harpale and Srihari Jayakumar and Debojeet Chatterjee and Mohsen Moslehpour and Pierce Chuang and Yichao Lu and Vikas Bhardwaj and Peyman Heidari},
  journal= {arXiv preprint arXiv:2602.13479},
  year   = {2026}
}