中文

BVI-CR:一个用于体积视频压缩的多视角人体数据集

计算机视觉与模式识别 2025-07-10 v1 图像与视频处理

摘要

沉浸式技术和三维重建的进步使得能够创建具有精细细节的真实世界物体和环境的数字副本。这些过程生成了大量的三维数据,需要更高效的压缩方法来满足与数据存储和传输相关的内存和带宽限制。然而,高效三维数据压缩方法的开发和验证受到缺乏全面且高质量的体积视频数据集的制约,与二维图像和视频数据库相比,获取这些数据集通常需要付出更多努力并消耗更多资源。为了弥补这一差距,我们提出了一个开放的多视角体积人体数据集,称为 BVI-CR,其中包含 18 个多视角 RGB-D 捕获及其相应的带纹理多边形网格,描绘了一系列多样化的人体动作。每个视频序列包含 10 个 1080p 分辨率的视角,持续时间为 10-15 秒,帧率为 30FPS。利用 BVI-CR,我们遵循 MPEG MIV 通用测试条件,对三种传统的和基于神经坐标的多视角视频压缩方法进行了基准测试,并基于各种质量指标报告了它们的码率质量性能。结果表明,与传统的视频编码方法相比,基于神经表示的方法在体积视频压缩方面具有巨大潜力(PSNR 平均编码增益高达 38%)。该数据集为包括体积重建、压缩和质量评估在内的多种任务提供了一个开发和验证平台。该数据库将在 \url{https://github.com/fan-aaron-zhang/bvi-cr} 上公开分享。

关键词

引用

@article{arxiv.2411.11199,
  title  = {BVI-CR: A Multi-View Human Dataset for Volumetric Video Compression},
  author = {Ge Gao and Adrian Azzarelli and Ho Man Kwan and Nantheera Anantrasirichai and Fan Zhang and Oliver Moolan-Feroze and David Bull},
  journal= {arXiv preprint arXiv:2411.11199},
  year   = {2025}
}