中文

LangFlash:从稀疏未定位图像的 3D 语言高斯溅射

计算机视觉与模式识别 2026-05-25 v1

摘要

我们提出 LangFlash,一个面向 3D 语言高斯溅射的前馈框架,通过稀疏未定位的多视角图像重建参数化由高斯原始块表示的 3D 场景,高斯块增强了来自语言对齐语义特征。不同于优化型 3D 方法,LangFlash 直接在单次前向传递中预测几何和语义,实现低延迟 3D 重建和语言一致的场景理解。为支持大规模训练,我们为 RealEstate10k 数据集增添了连贯且稠密的语义信息以用于 3D 语义监督。进一步,我们提出稀疏语义编码方案,将全局语义词典与局部可变每块权重相结合,保留高层语言信息,同时降低表示复杂度。实验结果表明,LangFlash 在新视角合成和语义一致性方面优于先前方法。本研究确立了面向无姿态、语言对齐 3D 场景重建的新范式,推动了通用 3D 视觉和多模态场景理解的发展。演示地址为 https://liylo.github.io/langflash.github.io/。

关键词

引用

@article{arxiv.2605.23287,
  title  = {LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images},
  author = {Yilong Liu and Wanhua Li and Chen Zhu-Tian and Hanspeter Pfister},
  journal= {arXiv preprint arXiv:2605.23287},
  year   = {2026}
}

备注

CVPRF 2026