StreamingEffect:实时人物导向视频特效生成
计算机视觉与模式识别
2026-05-19 v1
摘要
实时视频特效生成对直播人物相关应用(如电商直播、娱乐和 vlogging)极具需求,但由于缺乏合适的数据和可部署的编辑模型,仍面临困难。不同于通用视频生成,此任务需要在保持人物身份、背景内容和时间一致性的前提下,实现实时的视频到视频编辑以添加表现性特效。现有加速方法主要聚焦于文本到视频生成,而高效视频编辑蒸馏仍大体未被探索。本文提出了 StreamingEffect,一个实时人物导向流式视频特效框架。我们采用情境视频编辑架构,训练高质量的双向教师模型,然后蒸馏为因果自回归学生模型,并将采样步数从 50 步进一步降至 4 步。我们还引入关键帧控制,允许在线注入参考特效帧并通过流式传输进行交互式编辑。为解决数据瓶颈,我们构建了 VideoEffect-130K 数据集,据称是目前规模最大的人物导向视频特效数据集,包含 7 万特效视频和 6 万编辑视频,覆盖 600 个特效类别,数据来源于短视频平台和编辑平台。实验表明,我们的方法在单张 H200 GPU 上实现了实时、高质量的 720p 视频编辑。
引用
@article{arxiv.2605.17019,
title = {StreamingEffect: Real-Time Human-Centric Video Effect Generation},
author = {Yiren Song and Cheng Liu and Yuxin Jiang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2605.17019},
year = {2026}
}