中文

基于隐式辐射场的高保真人像视频会议分辨率无关神经压缩方法

计算机视觉与模式识别 2024-02-27 v1 图像与视频处理

摘要

视频会议近来备受关注。高保真度和低带宽是视频会议应用中视频压缩的两个主要目标。大多数开创性方法依赖于经典视频压缩编解码器,缺乏高层特征嵌入,因此无法达到极低带宽。近期的工作则采用基于模型的神经压缩,利用每帧的稀疏表示(如面部地标信息)来获取超低比特率,但这些方法由于基于二维图像变形而无法保持高保真度。在本文中,我们提出了一种新颖的低带宽神经压缩方法,用于高保真人像视频会议,利用隐式辐射场同时实现这两个主要目标。我们利用动态神经辐射场重建具有表情特征的高保真说话头,这些特征被表示为用于传输的帧替代。整个系统在发送端使用深度模型编码表情特征,在接收端使用体渲染作为解码器重建人像,从而实现超低带宽。特别地,基于神经辐射场模型的特性,我们的压缩方法与分辨率无关,这意味着我们方法实现的低带宽与视频分辨率无关,同时为更高分辨率的重建保持保真度。实验结果表明,我们的新框架能够 (1) 构建超低带宽视频会议,(2) 保持高保真人像,以及 (3) 在高分辨率视频压缩上比先前工作表现更优。

关键词

引用

@article{arxiv.2402.16599,
  title  = {Resolution-Agnostic Neural Compression for High-Fidelity Portrait Video Conferencing via Implicit Radiance Fields},
  author = {Yifei Li and Xiaohong Liu and Yicong Peng and Guangtao Zhai and Jun Zhou},
  journal= {arXiv preprint arXiv:2402.16599},
  year   = {2024}
}

备注

16 pages, 5 figures, accepted by IFTC2023