MobileVidFactory:基于扩散模型从文本自动生成移动端社媒视频
计算机视觉与模式识别
2023-08-01 v1
摘要
面向移动设备的视频近来成为分享和获取信息最流行的途径。为方便用户创作,本文提出一个系统MobileVidFactory,可自动生成竖屏移动视频,用户主要仅需提供简单文本。我们的系统由基础生成与定制生成两部分组成。在基础生成中,我们利用预训练的图像扩散模型,并将其适配为面向移动设备的高质量开放域竖屏视频生成器。至于音频,通过从我们的大型数据库中检索,系统为视频匹配合适的背景音。此外为生成定制内容,系统允许用户在视频中添加指定屏显文字以丰富视觉表达,并指定文本由可选嗓音进行自动朗读。
引用
@article{arxiv.2307.16371,
title = {MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text},
author = {Junchen Zhu and Huan Yang and Wenjing Wang and Huiguo He and Zixi Tuo and Yongsheng Yu and Wen-Huang Cheng and Lianli Gao and Jingkuan Song and Jianlong Fu and Jiebo Luo},
journal= {arXiv preprint arXiv:2307.16371},
year = {2023}
}
备注
Accepted by ACM-MM 2023 demo