中文

MARMOT:用于建模瞬时成像的掩码自编码器

计算机视觉与模式识别 2025-06-11 v1

摘要

预训练模型在诸多模态(如语言和视觉)中展现了惊人的成功。近期研究推动了成像领域的预训练范式。瞬时成像是一种新型模态,通过精确的时间分辨传感器捕获物体的光子计数随到达时间的变化。在非视线内(NLOS)场景中,瞬时成像可测量到传感器直接视线之外的隐形物体。目前多数研究通过优化体积密度或表面来重建隐藏物体,且未能从数据集中迁移先验知识。本文提出了一种用于建模瞬时成像的掩码自编码器,即 MARMOT,以促进 NLOS 应用。我们的 MARMOT 是在大规模且多样化的 NLOS 瞬时数据集上进行自监督预训练的。通过基于 Transformer 的编码器-解码器结构,MARMOT 利用扫描模式掩码(SPM)从部分被掩码的瞬时成像中学习特征,其中未被掩码的子集在功能上等价于任意采样,并预测完整的测量结果。在 50 万 3D 模型构成的合成瞬时数据集 TransVerse-a 上预训练后,MARMOT 可通过直接特征迁移或解码器微调适应下游成像任务。我们开展了与最新方法的全面实验比较。定量和定性结果均表明了 MARMOT 的高效性。

关键词

引用

@article{arxiv.2506.08470,
  title  = {MARMOT: Masked Autoencoder for Modeling Transient Imaging},
  author = {Siyuan Shen and Ziheng Wang and Xingyue Peng and Suan Xia and Ruiqian Li and Shiying Li and Jingyi Yu},
  journal= {arXiv preprint arXiv:2506.08470},
  year   = {2025}
}