CapTalk:文本引导的风格化与语音驱动的 3D 头部动画
计算机视觉与模式识别
2026-05-29 v1
摘要
音频驱动的 3D 面部动画旨在从任意音频剪辑生成同步的唇部动作和生动的面部表情。虽然现有方法可以产生同步的唇部动作,但它们往往依赖于预定义的身份或风格潜在特征,限制了用户对说话风格的自由控制。此外,将固定风格或身份应用于整个音频段通常会导致面部动画风格无法适应音频的情感内容。为此,我们重新审视了风格与情感之间的纠缠,构建了一个包含风格和情感文本描述的大规模数据集,并提出一种新的谈话头部生成框架,实现对风格和情感的独立控制。我们的模型同时接受说话风格和角色情感的文本描述,以及驱动音频流,实现高度同步的唇部动作和面部表情。此外,我们的模型支持在推理期间动态情感控制,能够处理目标情感在语音中变化的场景。
引用
@article{arxiv.2605.29316,
title = {CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation},
author = {Xuangeng Chu and Yuan Gan and Ziteng Cui and Shuhong Liu and Jian Wang and Bing Zhou and Tatsuya Harada},
journal= {arXiv preprint arXiv:2605.29316},
year = {2026}
}