Auto-CARD:面向实时移动临场通信的高效鲁棒编解码化身驱动
计算机视觉与模式识别
2025-01-07 v2
摘要
AR/VR 中用于临场通信的实时、鲁棒照片级真实化身备受期待,以赋能沉浸式照片级真实临场体验。然而,仍存在一项关键瓶颈:需耗费可观的计算开销,才能以匹配化身人类外观真实感的质量水平,准确推断由头显挂载相机捕获的面部表情。为此,我们提出名为 Auto-CARD 的框架,其首次仅使用纯设备端计算资源即实现 Codec Avatar 的实时、鲁棒驱动。这通过最小化两类冗余达成。首先,我们开发了一种专用于 AR/VR 中化身编码的神经架构搜索技术 AVE-NAS,其显式提升所搜架构在极端面部表情下的鲁棒性,以及对快速演进的 AR/VR 头显的硬件友好性。其次,我们利用连续渲染中连续捕获图像的时间冗余,并开发名为 LATEX 的机制以跳过冗余帧的计算。具体而言,我们首先从化身解码器导出的潜空间线性中识别契机,进而提出对冗余帧执行自适应潜空间外推。在评估中,我们展示了 Auto-CARD 框架在实时 Codec Avatar 驱动设定下的效能,其在 Meta Quest 2 上实现 5.05 倍加速,同时维持可与最先进化身编码器设计媲美甚至更优的动画质量。
引用
@article{arxiv.2304.11835,
title = {Auto-CARD: Efficient and Robust Codec Avatar Driving for Real-time Mobile Telepresence},
author = {Yonggan Fu and Yuecheng Li and Chenghui Li and Jason Saragih and Peizhao Zhang and Xiaoliang Dai and Yingyan Celine Lin},
journal= {arXiv preprint arXiv:2304.11835},
year = {2025}
}
备注
Accepted by CVPR 2023