大规模编解码器虚拟化身:大规模化身预训练的超凡有效性
计算机视觉与模式识别
2026-04-08 v2 图形学
摘要
高质量3D化身建模面临保真度与泛化能力之间的关键权衡。一方面,多视角影棚数据能够以对表情和姿态的精确控制实现高保真度的人体建模,但由于规模有限以及影棚环境与真实世界之间的域差距,难以泛化到真实世界数据。另一方面,近期在数百万野外样本上训练的大规模化身模型显示出跨广泛身份泛化的潜力,但由于固有的3D模糊性,生成的化身往往质量较低。为解决这一问题,我们提出了大规模编解码器虚拟化身(LCA),一种高保真、全身3D化身模型,能够以前馈方式泛化到世界规模的人群,实现高效推理。受大语言模型和视觉基础模型成功的启发,我们首次提出了3D化身建模的预训练/后训练范式:我们在100万野外视频上进行预训练,以学习外观和几何的广泛先验,然后在高质量精选数据上进行后训练,以增强表现力和保真度。LCA在保持强身份一致性的同时,泛化于各种发型、服装和人群特征,并提供精确、细粒度的面部表情和手指级关节控制。值得注意的是,我们观察到对可重照明性和宽松衣物支持在无约束输入上的涌现泛化,以及对风格化图像的零样本鲁棒性,尽管缺乏直接监督。
引用
@article{arxiv.2604.02320,
title = {Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining},
author = {Junxuan Li and Rawal Khirodkar and Chengan He and Zhongshi Jiang and Giljoo Nam and Lingchen Yang and Jihyun Lee and Egor Zakharov and Zhaoen Su and Rinat Abdrashitov and Yuan Dong and Julieta Martinez and Kai Li and Qingyang Tan and Takaaki Shiratori and Matthew Hu and Peihong Guo and Xuhua Huang and Ariyan Zarei and Marco Pesavento and Yichen Xu and He Wen and Teng Deng and Wyatt Borsos and Anjali Thakrar and Jean-Charles Bazin and Carsten Stoll and Ginés Hidalgo and James Booth and Lucy Wang and Xiaowen Ma and Yu Rong and Sairanjith Thalanki and Chen Cao and Christian Häne and Abhishek Kar and Sofien Bouaziz and Jason Saragih and Yaser Sheikh and Shunsuke Saito},
journal= {arXiv preprint arXiv:2604.02320},
year = {2026}
}
备注
Accepted in CVPR2026. Website: https://junxuan-li.github.io/lca