中文

语义编码器:通过算法与硬件协同优化实现无缝 Codec Avatar 执行

计算机视觉与模式识别 2025-10-30 v1 人工智能

摘要

高度写实的 Codec Avatar(PCA)通过深度学习生成模型在虚拟现实(VR)环境中生成高保真人脸渲染,正日益增长地用于实现沉浸式通信和交互。然而,这些模型对计算资源要求高,在资源受限的 VR 设备(如头戴式显示器)上实现实时推理具有挑战性,其中延迟和功耗效率至关重要。为解决这一挑战,我们提出了针对 Codec Avatar 模型的高效后训练量化(PTQ)方法,使其能在不牺牲输出质量的前提下实现低精度执行。此外,我们设计了可集成到系统单芯片(SoC)中的自定义硬件加速器,以进一步提升处理效率。基于这些组件,我们引入了 ESCA—a 全栈优化框架,可加速边缘 VR 平台上的 PCA 推理。实验结果表明,ESCA 将 FovVideoVDP 质量分数提升最高可达 +0.39+0.39,延迟降低最高可达 3.36×3.36\times,并在端到端测试中维持 100 帧/秒的渲染速率,满足实时 VR 要求。这些结果表明了在资源受限设备上部署高保真 Codec Avatar 的可行性,为更沉浸式和便携式 VR 体验开辟了可能性。

关键词

引用

@article{arxiv.2510.24787,
  title  = {ESCA: Enabling Seamless Codec Avatar Execution through Algorithm and Hardware Co-Optimization for Virtual Reality},
  author = {Mingzhi Zhu and Ding Shang and Sai Qian Zhang},
  journal= {arXiv preprint arXiv:2510.24787},
  year   = {2025}
}