Semantic Ray:通过交叉重投影注意力学习可泛化的语义场
计算机视觉与模式识别
2023-03-24 v1
摘要
本文旨在从多场景中学习一个准确、高效且可泛化的语义辐射场。尽管大多数现有NeRF面向神经场景渲染、图像合成与多视图重建任务,也有如Semantic-NeRF等少数尝试探索利用NeRF结构学习高层语义理解。然而,Semantic-NeRF使用多个头从单条光线同时学习颜色与语义标签,而单条光线无法提供丰富的语义信息。因此,Semantic NeRF依赖位置编码且需为每个场景训练特定模型。为此,我们提出Semantic Ray(S-Ray)以充分挖掘其多视图重投影沿光线方向的语义信息。由于直接对多视图重投影光线进行密集注意力会带来沉重计算开销,我们设计了交叉重投影注意力模块,包含连续的视图内径向注意力与跨视图稀疏注意力,将上下文信息沿重投影光线分解并跨多个视图,再通过堆叠模块收集密集连接。实验表明,我们的S-Ray能够从多场景学习,并对未见过场景表现出强泛化能力。
引用
@article{arxiv.2303.13014,
title = {Semantic Ray: Learning a Generalizable Semantic Field with Cross-Reprojection Attention},
author = {Fangfu Liu and Chubin Zhang and Yu Zheng and Yueqi Duan},
journal= {arXiv preprint arXiv:2303.13014},
year = {2023}
}
备注
Accepted by CVPR 2023. Project page: https://liuff19.github.io/S-Ray/