中文

UniLS:面向统一听说的端到端音频驱动式化身

计算机视觉与模式识别 2026-03-31 v2 声音

摘要

生成逼真的对话式化身需要建模不仅仅是孤立说话者,更要说话与倾听之间动态、相互作用的交互。然而,对倾听者进行建模异常具有挑战性:直接的音频驱动训练会失败,产生僵硬、静态的倾听动作。这种失败源于根本性的不平衡:说话者的动作受语音音频强烈驱动,而倾听者的动作主要遵循内部运动先验,仅受外部语音松散指引。此挑战导致大多数方法专注于说话-only 生成。唯一一次尝试进行联合生成的做法依赖额外的说话者动作来生成倾听者。这种设计不是端到端的,因而阻碍了实时应用。为解决这一限制,我们提出UniLS——首个用于生成统一说听表情的端到端框架,仅依赖双轨音频驱动。我们的方法引入了新颖的两阶段训练范例。阶段1首先通过训练无音频的自回归生成器来学习内部运动先验,捕捉自然面部动作的自发动态。阶段2随后引入双轨音频,对生成器进行精细调校,使其基于外部语音线索来调制已学习的运动先验。广泛的评估表明,UniLS在说话精度方面实现了最先进的水平。更重要的是,它在倾听指标上实现了最高44.1%的改进,生成显著更具多样性和自然性的倾听表情。这有效缓解了僵硬问题,为交互式数字人提供了实用的、高保真的音频驱动解决方案。代码和演示可在 https://xg-chu.site/project_unils/ 查看。

关键词

引用

@article{arxiv.2512.09327,
  title  = {UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking},
  author = {Xuangeng Chu and Ruicong Liu and Yifei Huang and Yun Liu and Yichen Peng and Bo Zheng},
  journal= {arXiv preprint arXiv:2512.09327},
  year   = {2026}
}

备注

CVPR 2026, code is available at https://github.com/xg-chu/UniLS, more demos are available at https://xg-chu.site/project_unils/