HM-Talker:用于高保真说话者头综合的混合运动建模
计算机视觉与模式识别
2026-05-29 v3
摘要
音频驱动的说话者头生成面临个人化与通用性之间的根本性权衡,这限制了其实际应用。隐式模型往往在结构一致性方面有牺牲,导致头部运动不稳定且唇部同步不准确。虽然显式方法包含如 3D 形状可塑模型 (3DMMs) 等几何和解剖先验,这些模型参数化面部几何,或如动作单元 (AUs) 等编码面部肌肉运动——但倾向于产生过于中性的表情,或 suffer from limited generalization。为解决此冲突,我们提出 HM-Talker,一个音频驱动的说话者头框架,通过综合显式发音线索与隐式韵律特征,既刻画身份特定的动态特征,又实现音频驱动的通用性。其独特特征可概括为:i) 跨模态映射模块 (CMMM),从音频和视频中提取全面的运动线索词汇;ii) 混合运动建模模块 (HMMM),采用随机特征配对 (SFP) 策略动态合并配对的隐式和显式特征以进行运动合成。此设计促进了下脸运动的迭代优化,在身份特定目标与身份中性 (仅音频) 目标之间交替。广泛的实验表明,HM-Talker 在视觉真实性和唇部同步准确性方面均优于最新方法,适用于多种场景。
引用
@article{arxiv.2508.10566,
title = {HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis},
author = {Shiyu Liu and Kui Jiang and Junjun Jiang and Xianming Liu and Xiaocheng Feng and Hongxun Yao and Qi Tian},
journal= {arXiv preprint arXiv:2508.10566},
year = {2026}
}