STARCaster:用于身份与视角感知说话肖像的时空自回归视频扩散
计算机视觉与模式识别
2025-12-16 v1
摘要
本文提出 STARCaster,一个身份感知的时空视频扩散模型,在统一框架内解决了语音驱动肖像动画和自由视角说话肖像合成两个问题,给定身份嵌入或参考图像。现有的二维语音到视频扩散模型严重依赖参考引导,导致运动多样性有限。与此同时,三维感知动画通常依赖于通过预训练三平面生成器的反演,这往往导致不完美的重建和身份漂移。我们从两个方面重新思考基于参考和基于几何的范式。首先,我们通过在预训练阶段引入更柔和的身份约束来偏离严格的参考条件。其次,我们通过利用视频数据固有的多视角特性,在二维视频域中隐式地处理三维感知。STARCaster 采用一种组合式方法,从身份感知的运动建模开始,到通过唇读监督实现音视频同步,最后通过时序到空间的适配实现新视角动画。为了克服四维音视频数据的稀缺性,我们提出了一种解耦学习方法,其中视角一致性和时序连贯性被独立训练。自强制训练方案使模型能够学习比推理时生成的更长时序上下文,缓解了现有自回归方法中常见的过于静态的动画问题。全面的评估表明,STARCaster 在不同任务和身份之间有效泛化,在不同基准测试中持续超越先前方法。
引用
@article{arxiv.2512.13247,
title = {STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits},
author = {Foivos Paraperas Papantoniou and Stathis Galanakis and Rolandos Alexandros Potamias and Bernhard Kainz and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:2512.13247},
year = {2025}
}
备注
Project page: https://foivospar.github.io/STARCaster/