中文

Long-LRM++:在前馈宽覆盖重建中保留精细细节

计算机视觉与模式识别 2026-05-01 v2

摘要

可泛化高斯溅射 (GS) 的最新进展已实现了从数十个输入视角对场景进行前馈重建。Long-LRM 显著地将这一范式扩展至 950×540950\times540 分辨率下的 32 张输入图像,在单次前向传播中实现了 360 度场景级重建。然而,直接一次性预测数百万个高斯参数仍然对误差高度敏感:位置或其他属性的微小不准确会导致明显的模糊,尤其是在文本等精细结构中。与此同时,LVSM 和 LaCT 等隐式表示方法通过将场景信息压缩到模型权重中而非显式高斯中,并使用完整的 Transformer 或 TTT 主干网络解码 RGB 帧,展示了显著更高的渲染保真度。然而,对每个渲染帧进行这种计算密集型的解压过程使得实时渲染变得不可行。这些观察引出了关键问题:深层的序列化“解压”过程是否必要?我们能否在保持隐式表示优势的同时实现实时性能?我们用 Long-LRM++ 回答了这些问题,该模型采用半显式场景表示结合轻量级解码器。Long-LRM++ 在 DL3DV 上匹配了 LaCT 的渲染质量,同时在 A100 GPU 上实现了 14 FPS 的实时渲染,克服了以往隐式方法的速度限制。我们的设计还可扩展至 950×540950\times540 分辨率下的 64 个输入视角,展示了对增加的输入长度的强泛化能力。此外,与直接从高斯进行深度渲染相比,Long-LRM++ 在 ScanNetv2 上提供了更优的新视角深度预测。广泛的消融实验验证了所提出框架中每个组件的有效性。

关键词

引用

@article{arxiv.2512.10267,
  title  = {Long-LRM++: Preserving Fine Details in Feed-Forward Wide-Coverage Reconstruction},
  author = {Chen Ziwen and Hao Tan and Peng Wang and Zexiang Xu and Li Fuxin},
  journal= {arXiv preprint arXiv:2512.10267},
  year   = {2026}
}