中文

TDMM-LM:通过语言模型桥接面部理解与动画

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

文本引导的人体动画研究迅速发展,但面部动画进展滞后,由于缺乏带有良好标注的、配对文本的面部语料库。为弥合这一差距,我们利用基础生成模型合成大规模、平衡的面部行为语料库。我们设计覆盖情绪和头部运动的提示套件,使用多个生成器生成约80小时的面部视频,并对每帧拟合3D面部参数,从而得到用于训练的大规模(提示和参数)配对数据。基于此数据集,我们探究了语言模型在面部运动中的双向能力,具体通过两种互补任务:(1)Motion2Language:给定3D面部参数序列,模型生成自然语言描述,捕捉内容、风格和动态;(2)Language2Motion:给定提示,模型通过量化运动标记合成相应的3D面部参数序列。大量实验表明,在此设置下,语言模型能够具备强大的泛化能力,既能解释也能合成面部运动。据我们所知,这是首次将面部参数建模作为语言问题进行建模,为文本条件面部动画和运动理解建立了统一路径。

关键词

引用

@article{arxiv.2603.16936,
  title  = {TDMM-LM: Bridging Facial Understanding and Animation via Language Models},
  author = {Luchuan Song and Pinxin Liu and Haiyang Liu and Zhenchao Jin and Yolo Yunlong Tang and Zichong Xu and Susan Liang and Jing Bi and Jason J Corso and Chenliang Xu},
  journal= {arXiv preprint arXiv:2603.16936},
  year   = {2026}
}

备注

12 pages, 13 figures