从 2D 到 3D 的一键升级:用于立体远程会议的夹层 RGB-D 视频压缩
计算机视觉与模式识别
2024-04-16 v1 图像与视频处理
摘要
由于需要实时压缩立体 RGB-D 视频,立体视频会议仍然具有挑战性。尽管 H.264 / AVC 和 HEVC 等标准视频编解码器的硬件实现被广泛使用,但它们并非为立体视频设计,存在质量和性能下降的问题。这些编解码器的特定多视图或 3D 扩展很复杂,且缺乏高效的实现。在本文中,我们提出了一种新方法,通过用神经预处理器和后处理器对对其进行封装,将 2D 视频编解码器升级以支持立体 RGB-D 视频压缩。神经网络通过图像编解码器代理进行端到端训练,并证明可以与更复杂的视频编解码器协同工作。我们还提出了一种几何感知损失函数来提高渲染质量。我们在合成的 4D 人物数据集上训练了神经预处理器和后处理器,并在合成和真实捕获的立体 RGB-D 视频上对其进行了评估。实验结果表明,神经网络对未见数据具有良好的泛化能力,并且可以开箱即用地与各种视频编解码器协同工作。与传统的视频编码方案和 MV-HEVC 相比,在相同的新视角渲染质量下,我们的方法节省了约 30% 的比特率,且无需特定任务的硬件升级。
引用
@article{arxiv.2404.09979,
title = {One-Click Upgrade from 2D to 3D: Sandwiched RGB-D Video Compression for Stereoscopic Teleconferencing},
author = {Yueyu Hu and Onur G. Guleryuz and Philip A. Chou and Danhang Tang and Jonathan Taylor and Rus Maxham and Yao Wang},
journal= {arXiv preprint arXiv:2404.09979},
year = {2024}
}
备注
Accepted by CVPR 2024 Workshop (AIS: Vision, Graphics and AI for Streaming https://ai4streaming-workshop.github.io )