中文

基于时序感知的精确动作控制头像生成框架——ActAvatar

计算机视觉与模式识别 2026-01-21 v2

摘要

尽管在说话化身生成方面取得了显著进展,但现有方法面临三个关键挑战:对多样化动作的文本跟随能力不足、动作与音频内容之间缺乏时序对齐,以及依赖额外的控制信号如姿态骨架。我们提出 ActAvatar,一个通过捕获动作语义和时序上下文来实现文本引导下动作控制的框架,能够在阶段层面实现精确控制。我们的方法引入了三个核心创新:(1)相位感知交叉注意(PACA),将提示分解为全局基块和时序锚定相位块,使模型能够专注于与相位相关的标记,以实现精确的时序-语义对齐;(2)渐进式音视频对齐,通过层次化特征学习过程实现模态影响的对齐——早期层次优先处理文本以建立动作结构,而更深层次强调音频以细化嘴部动作,防止模态干扰;(3)两阶段训练策略,即首先在多样化数据上建立稳健的音视频对应关系,然后通过在结构化注释数据上的微调注入动作控制,保持音视频对齐以及模型的文本跟随能力。广泛的实验表明,ActAvatar 在动作控制和视觉质量方面显著优于最先进的方法。

关键词

引用

@article{arxiv.2512.19546,
  title  = {ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars},
  author = {Ziqiao Peng and Yi Chen and Yifeng Ma and Guozhen Zhang and Zhiyao Sun and Zixiang Zhou and Youliang Zhang and Zhengguang Zhou and Zhaoxin Fan and Hongyan Liu and Yuan Zhou and Qinglin Lu and Jun He},
  journal= {arXiv preprint arXiv:2512.19546},
  year   = {2026}
}

备注

Project Page: https://ziqiaopeng.github.io/ActAvatar/