基于层次运动扩散模型的风格化实时人物视频生成
计算机视觉与模式识别
2025-03-28 v1
摘要
实时交互式视频聊天人物肖像正逐渐成为未来趋势, 特别是由于文本和语音聊天技术的显著进展。然而, 现有方法主要关注头部运动的实时生成, 但难以产生与这些头部动作相匹配的同步身体动作。此外, 实现对说话风格和面部表情细微差异的细粒度控制仍然是一个挑战。为解决这些限制, 我们引入一种新框架用于风格化实时人物视频生成,使其能够实现具有表现力和灵活性的视频聊天, 从说话头 extends 到上身互动.我们的方法包括以下两个阶段。第一个阶段涉及高效的层次运动扩散模型, 它基于音频输入考虑显式和隐式运动表示, 可生成多样化的面部表情并实现头部和身体动作之间的同步。第二个阶段旨在生成包含手势的上身人物视频。我们将显式手部控制信号注入生成器以产生更详细的手部动作, 并进一步进行面部细化以增强人物视频的整体真实性和表现力。此外, 我们的方法支持在 4090 GPU 上以最高 512×768 分辨率实现高达 30fps 的高效持续上身人物视频生成, 支持实时交互式视频聊天。实验结果表明, 我们的方法能够产生富有表现力且具有自然上身动作的人物视频。
引用
@article{arxiv.2503.21144,
title = {ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model},
author = {Jinwei Qi and Chaonan Ji and Sheng Xu and Peng Zhang and Bang Zhang and Liefeng Bo},
journal= {arXiv preprint arXiv:2503.21144},
year = {2025}
}
备注
Project Page: https://humanaigc.github.io/chat-anyone/