实现沉浸式体积视频:面向6自由度 VR 交互的多模态框架
计算机视觉与模式识别
2026-04-13 v1
摘要
高度沉浸式体验能够紧密集成6自由度的视觉与听觉交互,是虚拟和增强现实中的关键要素。虽然通过计算机生成内容可实现此类体验,但如何直接从真实世界捕获的视频中构建仍然鲜有探索。我们提出沉浸式体积视频(Immersive Volumetric Videos,IVV),一种新的体积媒体格式,旨在提供大规模6自由度交互空间、音视频反馈以及高分辨率、高帧率的动态内容。为支持IVV的构建,我们构建了ImViD数据集,基于面向空间的捕获哲学,采用多视角、多模态数据。我们设计的定制捕获装置能够在运动期间实现同步的多视角视频-音频采集,有效捕获具有丰富前景-背景相互作用和复杂动态的室内外场景。数据集提供5K分辨率、60 FPS的视频,时长为1-5分钟,相较于现有基准数据集在空间、时间和多模态覆盖上具有更丰富的特征。基于该数据集,我们开发了基于高斯函数时空表示的动态光场重建框架,融合了引导稀疏初始化、联合相机时序标定以及多项时空监督,实现对复杂运动的稳健且精确的建模。我们进一步提出,据我们所知,首个来自多视角音视频数据的声场重建方法。这些组件共同构成了统一的沉浸式体积视频生产管线。大量基准测试和沉浸式 VR 实验表明, our pipeline 生成的时空稳定的音视频体积内容具有广大的6自由度交互空间。本工作为沉浸式体积视频提供了基本定义与实际构建方法。
引用
@article{arxiv.2604.09473,
title = {Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement},
author = {Zhengxian Yang and Shengqi Wang and Shi Pan and Hongshuai Li and Haoxiang Wang and Lin Li and Guanjun Li and Zhengqi Wen and Borong Lin and Jianhua Tao and Tao Yu},
journal= {arXiv preprint arXiv:2604.09473},
year = {2026}
}
备注
Journal extension of CVPR 2025. See also arXiv:2503.14359 . Project page and code: https://github.com/Metaverse-AI-Lab-THU/ImViD