中文

Semantic Flow:从单目视频学习动态场景的语义场

计算机视觉与模式识别 2024-04-09 v1

摘要

在这项工作中,我们首创了 Semantic Flow,一种从单目视频中学习动态场景的神经语义表示。与以往从单个点的颜色和体密度重建动态场景的 NeRF 方法不同,Semantic Flow 从包含丰富 3D 运动信息的连续流中学习语义。由于从 2D 视频帧中提取 3D 流特征时在观察方向上存在 2D 到 3D 的歧义问题,我们将体密度视为不透明度先验,以描述流特征对帧上语义的贡献。更具体地说,我们首先学习一个流网络来预测动态场景中的流,并提出一个流特征聚合模块来从视频帧中提取流特征。然后,我们提出一个流注意力模块来从流特征中提取运动信息,随后通过一个语义网络输出流的语义逻辑值。我们在观察方向上将逻辑值与体密度相结合,以用视频帧上的语义标签监督流特征。实验结果表明,我们的模型能够从多个动态场景中学习,并支持一系列新任务,如实例级场景编辑、语义补全、动态场景跟踪和新场景上的语义自适应。代码可在 https://github.com/tianfr/Semantic-Flow/ 获取。

关键词

引用

@article{arxiv.2404.05163,
  title  = {Semantic Flow: Learning Semantic Field of Dynamic Scenes from Monocular Videos},
  author = {Fengrui Tian and Yueqi Duan and Angtian Wang and Jianfei Guo and Shaoyi Du},
  journal= {arXiv preprint arXiv:2404.05163},
  year   = {2024}
}

备注

Accepted by ICLR 2024, Codes are available at https://github.com/tianfr/Semantic-Flow/