中文

探索面部动作生成的时间线控制

计算机视觉与模式识别 2025-05-28 v1

摘要

本文为面部动作生成引入一种新的控制信号:时间线控制。与音频和文本信号相比,时间线提供了更细粒度的控制,例如生成具有精确时序的特定面部动作。用户可以指定一个按时间区间排列的多轨面部动作时间线,从而精确控制每个动作的时序。为了建模时间线控制能力,我们首先以帧级粒度标注自然面部动作序列中面部动作的时间区间。这一过程通过基于Toeplitz逆协方差的聚类方法辅助完成,以最大限度地减少人工劳动。基于这些标注,我们提出了一种基于扩散的生成模型,能够生成自然且与输入时间线精确对齐的面部动作。我们的方法支持文本引导的动作生成,通过使用ChatGPT将文本转换为时间线。实验结果表明,我们的方法能够以令人满意的精度标注面部动作区间,并生成与时间线精确对齐的自然面部动作。

关键词

引用

@article{arxiv.2505.20861,
  title  = {Exploring Timeline Control for Facial Motion Generation},
  author = {Yifeng Ma and Jinwei Qi and Chaonan Ji and Peng Zhang and Bang Zhang and Zhidong Deng and Liefeng Bo},
  journal= {arXiv preprint arXiv:2505.20861},
  year   = {2025}
}

备注

Accepted by CVPR 2025, Project Page: https://humanaigc.github.io/facial-motion-timeline-control/