中文

MobileVidFactory:基于扩散模型从文本自动生成移动端社媒视频

计算机视觉与模式识别 2023-08-01 v1

摘要

面向移动设备的视频近来成为分享和获取信息最流行的途径。为方便用户创作,本文提出一个系统MobileVidFactory,可自动生成竖屏移动视频,用户主要仅需提供简单文本。我们的系统由基础生成与定制生成两部分组成。在基础生成中,我们利用预训练的图像扩散模型,并将其适配为面向移动设备的高质量开放域竖屏视频生成器。至于音频,通过从我们的大型数据库中检索,系统为视频匹配合适的背景音。此外为生成定制内容,系统允许用户在视频中添加指定屏显文字以丰富视觉表达,并指定文本由可选嗓音进行自动朗读。

关键词

引用

@article{arxiv.2307.16371,
  title  = {MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text},
  author = {Junchen Zhu and Huan Yang and Wenjing Wang and Huiguo He and Zixi Tuo and Yongsheng Yu and Wen-Huang Cheng and Lianli Gao and Jingkuan Song and Jianlong Fu and Jiebo Luo},
  journal= {arXiv preprint arXiv:2307.16371},
  year   = {2023}
}

备注

Accepted by ACM-MM 2023 demo