LangFlash:从稀疏未定位图像的 3D 语言高斯溅射
计算机视觉与模式识别
2026-05-25 v1
摘要
我们提出 LangFlash,一个面向 3D 语言高斯溅射的前馈框架,通过稀疏未定位的多视角图像重建参数化由高斯原始块表示的 3D 场景,高斯块增强了来自语言对齐语义特征。不同于优化型 3D 方法,LangFlash 直接在单次前向传递中预测几何和语义,实现低延迟 3D 重建和语言一致的场景理解。为支持大规模训练,我们为 RealEstate10k 数据集增添了连贯且稠密的语义信息以用于 3D 语义监督。进一步,我们提出稀疏语义编码方案,将全局语义词典与局部可变每块权重相结合,保留高层语言信息,同时降低表示复杂度。实验结果表明,LangFlash 在新视角合成和语义一致性方面优于先前方法。本研究确立了面向无姿态、语言对齐 3D 场景重建的新范式,推动了通用 3D 视觉和多模态场景理解的发展。演示地址为 https://liylo.github.io/langflash.github.io/。
引用
@article{arxiv.2605.23287,
title = {LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images},
author = {Yilong Liu and Wanhua Li and Chen Zhu-Tian and Hanspeter Pfister},
journal= {arXiv preprint arXiv:2605.23287},
year = {2026}
}
备注
CVPRF 2026