中文

FlowAct-R1:迈向交互式人形视频生成

计算机视觉与模式识别 2026-01-16 v1 人工智能

摘要

交互式人形视频生成旨在合成逼真的视觉代理,使其能够通过连续且响应迅速的视频与人类互动。尽管视频合成技术近期取得了进展,但现有方法往往难以在高保真合成与实时交互需求之间取得平衡。本文提出 FlowAct-R1,一个专为实时交互式人形视频生成而设计的框架。该框架基于 MMDiT 架构构建,能够在保持低延迟响应的同时,实现任意时长的流式视频合成。我们引入了一种分块扩散强制策略,并辅以一种新颖的自强制变体,以减轻误差累积并确保连续交互过程中的长期时序一致性。通过利用高效的蒸馏和系统级优化,我们的框架在 480p 分辨率下实现了稳定的 25fps,首帧生成时间(TTFF)仅约 1.5 秒。所提出的方法提供了整体且细粒度的全身控制,使代理能够在交互场景中自然地在不同行为状态之间转换。实验结果表明,FlowAct-R1 实现了卓越的行为生动性和感知真实感,同时在不同角色风格上保持了稳健的泛化能力。

关键词

引用

@article{arxiv.2601.10103,
  title  = {FlowAct-R1: Towards Interactive Humanoid Video Generation},
  author = {Lizhen Wang and Yongming Zhu and Zhipeng Ge and Youwei Zheng and Longhao Zhang and Tianshu Hu and Shiyang Qin and Mingshuang Luo and Jiaxu Zhang and Xin Chen and Yulong Wang and Zerong Zheng and Jianwen Jiang and Chao Liang and Weifeng Chen and Xing Wang and Yuan Zhang and Mingyuan Gao},
  journal= {arXiv preprint arXiv:2601.10103},
  year   = {2026}
}