中文

SqueezeMe:高效移动端高斯全身人形姿态蒸馏

计算机视觉与模式识别 2025-07-01 v4

摘要

基于高效能神经网络的人形姿态已实现前所未有的视觉保真度,但现有方法通常需要桌面GPU才能为单个姿态实现实时性能,且在内存和计算带宽受限的移动设备(包括独立VR头盔)上进行姿态动画和渲染仍颇具挑战。本文提出SqueezeMe,一个简单且高度有效的框架,用于将高保真度3D高斯全身人形姿态转换为支持移动级计算下动画和渲染的轻量化表示。我们的关键观察是,来自神经网络的姿态依赖性高斯属性解码会产生显著的内存和计算开销。我们受计算机图形中广泛使用的混合形状和线性姿态校正技术启发,将神经网络学习到的姿态校正蒸馏到线性层中。此外,我们进一步通过在相邻高斯之间共享校正参数来减少参数数量。结合基于Vulkan的自定义渲染管线,我们首次实现了在Meta Quest 3 VR头盔上实时(72 FPS)进行3个高斯姿态的同步动画和渲染。演示视频可在https://forresti.github.io/squeezeme 查看。

关键词

引用

@article{arxiv.2412.15171,
  title  = {SqueezeMe: Mobile-Ready Distillation of Gaussian Full-Body Avatars},
  author = {Forrest Iandola and Stanislav Pidhorskyi and Igor Santesteban and Divam Gupta and Anuj Pahuja and Nemanja Bartolovic and Frank Yu and Emanuel Garbin and Tomas Simon and Shunsuke Saito},
  journal= {arXiv preprint arXiv:2412.15171},
  year   = {2025}
}

备注

Accepted to SIGGRAPH 2025