中文

3DXTalker:统一身份、唇同步、情感与空间动态的表现力 3D 说话人

计算机视觉与模式识别 2026-04-06 v3

摘要

音频驱动的 3D 说话人生成日益重要于虚拟通讯、数字人类和交互媒体,要求模型在保持身份、同步唇部动作、表达情感以及展现逼真的空间动态方面具备表现力。然而,这一目标仍具有挑战性,主要由于训练数据中主体身份有限、音频表示狭窄以及显式可控性受限。本文提出3DXTalker,通过数据精选的身份建模、音频丰富表示和空间动态可控性,构建一种表现力强的 3D 说话人。3DXTalker 通过 2D 到 3D 数据 curated 管道和解耦表示实现可扩展的身份建模,缓解数据稀缺问题并提升身份泛化能力。随后,我们引入超出标准语音嵌入的帧级振幅和情感线索,确保唇部同步和细腻的情感表达调制。这些线索由基于流匹配的 transformer 统一调制,实现连贯的面部动态。此外,3DXTalker 还支持自然的头部姿态生成,并通过基于提示的条件实现风格化控制。广泛的实验表明,3DXTalker 在统一框架内集成了唇部同步、情感表达和头部姿态动态,实现了在 3D 说话人生成方面的卓越性能。

关键词

引用

@article{arxiv.2602.10516,
  title  = {3DXTalker: Unifying Identity, Lip Sync, Emotion, and Spatial Dynamics in Expressive 3D Talking Avatars},
  author = {Zhongju Wang and Zhenhong Sun and Beier Wang and Yifu Wang and Daoyi Dong and Huadong Mo and Hongdong Li},
  journal= {arXiv preprint arXiv:2602.10516},
  year   = {2026}
}