InsTaG:从几秒视频中学习个性化 3D 说话头
计算机视觉与模式识别
2025-02-28 v1
摘要
尽管基于辐射场的方法在 synthesizing 逼真的个性化 3D 说话头方面表现突出,但这些方法对每个新身份都需要大量训练数据和时间。本文引入 InsTaG,一个允许从少量训练数据快速学习逼真个性化 3D 说话头的框架。基于轻量级 3DGS person-specific synthesizer 构建,InsTaG 在保持高水平个性化和效率的同时,实现了高质量和快速适应。作为准备工作,我们首先提出了无身份预训练策略,使 person-specific 模型能够从长视频数据语料库中收集通用运动先验。为充分利用通用运动先验学习未知新身份,我们然后提出了 Motion-Aligned Adaptation 策略,用于自适应地将目标头部对齐到预训练场中,并在有限训练数据下约束鲁棒的动态头部结构。实验表明,我们在各种数据场景下实现了卓越的性能和效率,以渲染高质量的个性化说话头。
引用
@article{arxiv.2502.20387,
title = {InsTaG: Learning Personalized 3D Talking Head from Few-Second Video},
author = {Jiahe Li and Jiawei Zhang and Xiao Bai and Jin Zheng and Jun Zhou and Lin Gu},
journal= {arXiv preprint arXiv:2502.20387},
year = {2025}
}
备注
Accepted at CVPR 2025. Project page: https://fictionarry.github.io/InsTaG/