中文

Pre-Avatar:一种利用说话虚拟形象的自动演示生成框架

人工智能 2022-10-14 v1

摘要

自 COVID-19 疫情爆发以来,远程会议与远程教学已成为重要工具。以往的应用旨在借助实时交互来节省通勤成本。然而,我们的应用致力于降低准备交流材料时的制作与复现成本。本文提出一个名为 Pre-Avatar 的系统,仅需 1 张正面照片和 3 分钟录音,即可生成带有目标说话人说话面部的演示视频。在技术层面,该系统由三大主要模块组成:用户体验界面(UEI)、说话面部模块与少样本文本转语音(TTS)模块。系统首先克隆目标说话人的声音,随后生成语音,最后生成具有恰当唇部与头部运动的虚拟形象。在任何场景下,用户只需替换带有不同备注的幻灯片即可生成另一段新视频。该演示已在此发布,并将作为免费软件公开发布供使用。

关键词

引用

@article{arxiv.2210.06877,
  title  = {Pre-Avatar: An Automatic Presentation Generation Framework Leveraging Talking Avatar},
  author = {Aolan Sun and Xulong Zhang and Tiandong Ling and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2210.06877},
  year   = {2022}
}

备注

Accepted by ICTAI2022. The 34th IEEE International Conference on Tools with Artificial Intelligence (ICTAI)