文本到视频:一种用于零样本身份无关说话头生成的双阶段框架
计算机视觉与模式识别
2023-08-15 v1 计算与语言
摘要
ChatGPT 的出现为信息收集与分析引入了创新方法。然而,ChatGPT 提供的信息仅限于文本,且这些信息可视化的程度仍然有限。先前的研究探索了零样本文本到视频(TTV)方法以将文本转化为视频。然而,这些方法缺乏对生成音频身份的操控能力,即并非身份无关的,从而制约了其实用效果。为克服这一局限,我们提出了一种新颖的、针对人的视频克隆双阶段框架,特别关注 TTV 生成。在第一阶段,我们利用预训练的零样本模型实现文本到语音(TTS)转换。在第二阶段,采用音频驱动的说话头生成方法,基于第一阶段生成的音频合成具有说服力的视频。本文对不同 TTS 与音频驱动说话头生成方法进行了对比分析,确定了最具前景的后续研究与开发路径。部分音频与视频样本见以下链接:https://github.com/ZhichaoWang970201/Text-to-Video/tree/main。
引用
@article{arxiv.2308.06457,
title = {Text-to-Video: a Two-stage Framework for Zero-shot Identity-agnostic Talking-head Generation},
author = {Zhichao Wang and Mengyu Dai and Keld Lundgaard},
journal= {arXiv preprint arXiv:2308.06457},
year = {2023}
}
备注
6 pages