前瞻锚定:音频驱动人类动画中的角色身份保持
计算机视觉与模式识别
2025-10-28 v1 机器学习
摘要
音频驱动的人类动画模型在时序自回归生成过程中常出现身份漂移问题,即角色随时间逐渐失去原有身份。一种解决思路是生成关键帧作为中间时间锚点以防止退化,但需额外的关键帧生成阶段且可能限制运动的自然动态。为此,我们提出前瞻锚定(Lookahead Anchoring)方法,利用当前生成窗口之外未来时间步的关键帧作为参考,而非窗口内的关键帧。将关键帧从固定边界转化为方向性灯塔:模型在响应即时音频信号的同时,不断追逐这些前瞻锚点,以持续指引维持身份一致性。该方法实现自关键帧化(self-keyframing),即参考图像本身即为前瞻目标,从而无需额外生成关键帧。我们发现,时序前瞻距离自然控制表达性与一致性之间的平衡:更大的前瞻距离允许更自由的运动,而更小的前瞻距离强化身份一致性。在三个近期人类动画模型上应用后,前瞻锚定在同步性、身份保持和视觉质量方面取得优异性能,展示了在多种不同架构下提升的时序条件能力。视频结果已提供链接:https://lookahead-anchoring.github.io。
引用
@article{arxiv.2510.23581,
title = {Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation},
author = {Junyoung Seo and Rodrigo Mira and Alexandros Haliassos and Stella Bounareli and Honglie Chen and Linh Tran and Seungryong Kim and Zoe Landgraf and Jie Shen},
journal= {arXiv preprint arXiv:2510.23581},
year = {2025}
}
备注
Project page: https://lookahead-anchoring.github.io