高效-LVSM:通过解耦共精炼注意力实现更快更便宜更好的大视角合成模型
计算机视觉与模式识别
2026-02-09 v1 人工智能
摘要
基于Transformer的方法如LVSM在新视角合成(NVS)中通过对所有输入视角和目标视角之间的注意力机制取得了进展。本文指出,其完全自注意力设计并非最优,由于输入视角数量导致二次复杂度以及异构token之间僵化的参数共享问题。我们提出的Efficient-LVSM采用解耦共精炼机制,构建双流架构以避免上述问题。它对输入视角应用视内自注意力,对目标视角应用视后交叉注意力,消除不必要的计算。Efficient-LVSM在RealEstate10K上以2个输入视角达到29.86 dB PSNR,超越LVSM0.2 dB,训练收敛速度提升2倍,推理速度提升4.4倍。Efficient-LVSM在多个基准上实现了最先进的性能,表现出对未见视角数量的强大零样本泛化能力,并能通过KV-cache实现增量推理。
引用
@article{arxiv.2602.06478,
title = {Efficient-LVSM: Faster, Cheaper, and Better Large View Synthesis Model via Decoupled Co-Refinement Attention},
author = {Xiaosong Jia and Yihang Sun and Junqi You and Songbur Wong and Zichen Zou and Junchi Yan and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2602.06478},
year = {2026}
}
备注
Accepted at ICLR 2026