Loki:基于扩散的肖像动画表示论
计算机视觉与模式识别
2026-05-26 v1
摘要
肖像动画将驾驶剪辑的面部表情和头部姿态传递到单个参考图像上,同时保留参考图像的身份。最先进的扩散系统通过依次堆叠为表情、姿态和身份训练的模块来实现此功能,但为此付出了可训练参数、专有语料库和残余耦合的代价,而这些轴本是应该独立控制的。这种复杂性补偿了上游选择——即从 RGB 中学习面部表情和头部姿态,这是一种在没有独立学习的情况下,身份、姿态和表情不可分离的表示。Loki 跳出了 RGB 条件路径。驾驶的表情和头部姿态由其参数轴在构造上与身份正交的面部模型编码,然后光栅化为空间图,供扩散主干直接消费。身份通过扩散主干自身预训练特征的轻量级键值注入分离路由。由于参数表示将身份从表情和姿态中解耦,跨 ID 重演 reduces to a coefficient substitution at inference,无需跨 ID 训练数据。Loki 比领先的扩散基线所需的推理参数少约 43%,且仅使用 1496 倍的视频样本进行训练。我们定义两个直接衡量生成头部姿态轨迹和面部表情是否遵循驾驶者意图的指标——这实际上是肖像动画所问的两个问题;Loki 在两个指标上均名列前茅或并列领先。
引用
@article{arxiv.2605.24176,
title = {Loki: Representation over Architecture for Diffusion-Based Portrait Animation},
author = {Pouyan Navard and Sernam Lim},
journal= {arXiv preprint arXiv:2605.24176},
year = {2026}
}