FLEG:基于紧凑语义表示的任意视角 feed-forward 语言嵌入高斯溅
计算机视觉与模式识别
2026-04-07 v2
摘要
我们提出FLEG,一个从任意视角重建语言嵌入式3D高斯的 feed-forward 网络。以往的feed-forward语言嵌入高斯重建方法受限于固定数量的输入视角,通常将语言对齐语义嵌入附加到每个高斯上,导致实际操作输入设置不实用且存在语义冗余。相反,我们引入几何-语义双支路蒸馏框架,使其能够从任意多视角图像中进行输入,无需相机参数。我们还提出了一种基于新视角的蒸馏策略,以缓解对输入视角的过拟合。此外,我们发现语义表示显著稀疏于几何表示,逐个高斯附加语言嵌入是不必要的。为充分利用这种稀疏性,我们设计了一种解耦式语言嵌入策略,以稀疏的语义高斯集合表示语言信息,而非为每个高斯附加嵌入。与稠密像素对齐的逐高斯嵌入方案相比,我们的方法仅使用5%的语言嵌入,即可保持相当的语义保真度,有效降低了存储成本。广泛的实验表明,FLEG在重建质量和语言对齐语义表示方面均优于当前最先进的feed-forward重建和语言嵌入高斯方法。项目页面:https://fangzhou2000.github.io/projects/fleg。
关键词
引用
@article{arxiv.2512.17541,
title = {FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation},
author = {Qijian Tian and Xin Tan and Jiayu Ying and Xuhong Wang and Yuan Xie and Lizhuang Ma},
journal= {arXiv preprint arXiv:2512.17541},
year = {2026}
}
备注
Project page: https://fangzhou2000.github.io/projects/fleg