EchoMimicV3:13亿参数就足够——统一的多模态多任务人类动画
计算机视觉与模式识别
2026-03-03 v5
摘要
最近的工作在人类动画中通常融合大规模视频模型,从而实现更生动的表现。然而,这些方法的实际应用受限于推理速度慢且计算需求高。此外,传统方法通常为每种动画任务采用单独模型,增加了多任务场景中的成本,恶化了困境。为此,我们引入EchoMimicV3,一个高效的框架,统一了多任务和多模态人类动画。在EchoMimicV3的核心位于三重设计:任务之汤(Soup-of-Tasks)范式、模态之汤(Soup-of-Modals)范式,以及一种新颖的训练和推理策略。任务之汤利用多任务掩码输入和一种反直觉的任务分配策略,以实现无需多模型的多任务收益。与此同时,模态之汤引入Coupled-Decoupled Multi-Modal Cross Attention模块以注入多模态条件,配合Multi-Modal Timestep Phase-aware Dynamical Allocation机制以调节多模态混合。此外,我们提出了负向直接偏好优化(Negative Direct Preference Optimization)、相位感知负向无分类器自由引导(Phase-aware Negative Classifier-Free Guidance,CFG)以及长视频CFG,这些方法确保了稳定的训练和推理。大量实验和分析表明,EchoMimicV3以最小的模型规模(13亿参数)即可在定量和定性评估中实现与竞争水平的表现。
关键词
引用
@article{arxiv.2507.03905,
title = {EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation},
author = {Rang Meng and Yan Wang and Weipeng Wu and Ruobing Zheng and Yuming Li and Chenguang Ma},
journal= {arXiv preprint arXiv:2507.03905},
year = {2026}
}