FantasyTalking2:基于时间步层自适应偏好优化的音频驱动人物动画
计算机视觉与模式识别
2025-08-18 v1
摘要
近期的音频驱动人物动画技术取得了显著进展。然而,现有方法在细粒度人类偏好(如运动自然性、唇音同步准确性和视觉质量)上难以实现对齐。这源于在多目标偏好优化中存在难题,这些目标常相互冲突,且缺乏规模大且多维偏好标注的高质量数据集。为此,我们首先引入Talking-Critic,一种多模态奖励模型,学习人类对齐的奖励函数,以量化生成视频在多维期望上的表现。基于该模型,我们构建了包含41万偏好对的大规模多维人类偏好数据集Talking-NSQ。最终,我们提出了一种名为Timestep-Layer adaptive multi-expert Preference Optimization(TLPO)的新框架,用于将基于扩散的人物动画模型与细粒度、多维偏好对齐。TLPO将偏好解耦为专门的专家模块,再跨时间步和网络层融合,从而在所有维度上实现全面、细粒度的增强,避免相互干扰。实验表明,Talking-Critic在对齐人类偏好评分方面显著优于现有方法。与基线模型相比,TLPO在唇音同步准确性、运动自然性和视觉质量方面实现了显著提升,凭借定性和定量评估均表现出优异性能。项目页面:https://fantasy-amap.github.io/fantasy-talking2/
引用
@article{arxiv.2508.11255,
title = {FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation},
author = {MengChao Wang and Qiang Wang and Fan Jiang and Mu Xu},
journal= {arXiv preprint arXiv:2508.11255},
year = {2025}
}
备注
https://fantasy-amap.github.io/fantasy-talking2/