DVSM:正确实现的解码器-only视图合成模型
计算机视觉与模式识别
2026-05-29 v1
摘要
最近的大型视图合成模型(LVSM)主张采用编码器-解码器架构,将重建和渲染分离为独立网络。我们重新审视了这一设计。通过控制实验,我们表明采用仅解码器架构(以KV-cache形式隐式表示场景)在相同渲染复杂度下,以更少参数 outperform 编码器-解码器变体。进一步分析显示,颜色输入重建网络与仅相机渲染网络之间共享权重,可更好地对齐同一视点的特征,从而促进图像合成。基于这一发现,我们的模型DVSM进一步引入了基础模型先验和分阶段patch大小,以实现更佳的效率-质量 tradeoff。我们的结果在多个基准上建立了新纪录,某些情况下甚至在稠密输入视图下超越了针对每个场景优化的3DGS。
关键词
引用
@article{arxiv.2605.29891,
title = {DVSM: Decoder-only View Synthesis Model Done Right},
author = {Cheng Sun and Jaesung Choe and Min-Hung Chen and Ryo Hachiuma and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2605.29891},
year = {2026}
}
备注
Code at https://github.com/NVLabs/dvsm