MIRRORTALK:基于解耦风格和层次运动控制的个人化头像生成
计算机视觉与模式识别
2026-02-02 v1 声音
摘要
合成能够保持并突出说话者独特风格的个性化说话面部仍是重大挑战。现有方法的主要局限是说话风格与语义内容在面部运动中的内在混合,阻止了将说话者的独特人格忠实地传递到任意语音中。本文提出了 MirrorTalk,一种基于条件扩散模型的生成框架,结合语义解耦风格编码器 (SDSE),可从简短的参考视频中提取纯粹的风格表示。为有效利用此表示,我们进一步引入扩散过程中的层次调制策略。该机制在不同面部区域动态平衡音频和风格特征的贡献,确保精确的唇同步准确性和富有表现力的全面动态。大量实验表明,MirrorTalk 在唇同步准确性和个人化保持方面显著优于最先进的方法。
引用
@article{arxiv.2601.22501,
title = {MIRRORTALK: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control},
author = {Renjie Lu and Xulong Zhang and Xiaoyang Qu and Jianzong Wang and Shangfei Wang},
journal= {arXiv preprint arXiv:2601.22501},
year = {2026}
}
备注
Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)