通过语义-空间解耦解决前馈新视角合成 Transformer 中的表示歧义
计算机视觉与模式识别
2026-05-19 v1
摘要
基于 Transformer 的模型推进了前馈新视角合成(NVS)。诸如 GS-LRM 和 LVSM 等当前架构将语义信息(如 RGB)和空间信息(如 Pl"ucker 射线)混合到共享的特征空间中。由于 Pl"ucker 射线天然带有晶格状的空间结构,这些设计会使空间偏差干扰外观表示并降低渲染保真度。为此,我们提出将前馈 NVS Transformer 的表示解耦为独立的语义 token 和空间 token。这种解耦设计使语义和空间信息在其各自的分支中保持显式,同时通过共享注意力路由保持跨分支交互。基于此设计,我们引入了可选的分类监督和双向调制:前者提供特定于分支的训练信号,而后者改善两个分支之间的交互。值得注意的是,基础解耦设计由于其架构设计几乎不引入任何额外的推断延迟。所提出的设计实现了一致的改进,证明了其在纯解码器和编码器-解码器前馈 NVS 模型中的有效性。
引用
@article{arxiv.2605.18599,
title = {Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling},
author = {Yihang Wu and Yihang Sun and Shaofeng Zhang and Zuxuan Wu and Junchi Yan and Xiaosong Jia and Yu-gang Jiang},
journal= {arXiv preprint arXiv:2605.18599},
year = {2026}
}
备注
24 pages, 11 figures, 4 tables. Project page: https://hangzay.github.io/ssd_lvsm/