中文

ProCap: 空间增强现实中的投影感知描述生成

计算机视觉与模式识别 2026-04-10 v1 多媒体

摘要

空间增强现实(SAR)直接使用投影仪将数字内容投射到物理场景中,从而在不依赖头戴式显示器的情况下创造沉浸式体验。然而,SAR若要支持智能交互(如场景推理或回答用户查询),就必须在语义上区分物理场景与投射内容。标准的视觉语言模型(VLMs)难以应对这种虚拟-物理模糊性,经常混淆两种上下文。为解决这一问题,我们提出了ProCap,一个显式解耦投射内容与物理场景的新型框架。ProCap采用两阶段流水线:首先通过自动分割在视觉上分离虚拟层与物理层;然后利用区域感知检索来避免因投影畸变导致的语义上下文歧义。为此,我们提出了RGBP(RGB + 投影),首个大规模SAR语义基准数据集,包含65个多样化物理场景和超过180,000个投射内容,并具有密集、解耦的标注。最后,我们建立了基于任务特定标记的双描述评估协议,以独立评估物理场景描述与投射内容描述。实验结果表明,ProCap为未来的SAR研究提供了稳健的语义基础。源代码、预训练模型和RGBP数据集可在项目页面获取:https://ZimoCao.github.io/ProCap/。

关键词

引用

@article{arxiv.2604.00912,
  title  = {ProCap: Projection-Aware Captioning for Spatial Augmented Reality},
  author = {Zimo Cao and Yuchen Deng and Haibin Ling and Bingyao Huang},
  journal= {arXiv preprint arXiv:2604.00912},
  year   = {2026}
}

备注

16 pages, 7 figures