中文

Virbo:数字营销中的多模态多语言数字人视频生成

多媒体 2024-03-25 v2

摘要

随着网红营销在全球范围内的广泛普及,短视频制作已逐渐成为呈现产品信息的一种流行方式。然而,传统的视频制作行业通常包含一系列流程,如剧本撰写、专业影棚拍摄、视频剪辑、特效渲染及定制化后期处理等。更不用说多语言视频对于不会说多种语言的人来说是难以接触的。这些复杂的流程通常需要专业团队来完成,使得短视频制作在时间和金钱上成本高昂。本文提出了一种支持自动生成说话数字人视频的智能系统,即 Virbo。仅需用户指定的剧本,Virbo 即可利用深度生成模型生成目标说话视频。同时,该系统还支持多模态输入,以指定的人脸、指定的声音和特效来定制视频。该系统还集成了多语言定制模块,支持利用数百个精美模板和创意特效批量生成多语言说话数字人视频。通过一系列用户研究和演示测试,我们发现 Virbo 生成的说话数字人视频能够保持与专业团队相当的高质量,同时显著降低了整体制作成本。这一智能系统将有效促进视频制作行业的发展,并推动互联网营销跨越语言障碍与成本挑战。

关键词

引用

@article{arxiv.2403.11700,
  title  = {Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing},
  author = {Juan Zhang and Jiahao Chen and Cheng Wang and Zhiwang Yu and Tangquan Qi and Can Liu and Di Wu},
  journal= {arXiv preprint arXiv:2403.11700},
  year   = {2024}
}