面向真实语音动画的音视频同步技术综合综述与分类
音频与语音处理
2024-08-29 v2
摘要
在许多应用中,同步音频与视觉内容至关重要,例如在为电影或游戏创建图形动画、将电影音频翻译成不同语言以及开发元宇宙应用方面。本综述探讨了实现从音频输入生成逼真面部动画的各种方法,突出生成式和自适应模型。针对模型训练成本、数据集可用性以及音频数据中静默时刻的分布等挑战,呈现了创新解决方案以提升性能和逼真度。研究还引入了一种新分类法来划分音视频同步方法,基于日志istical aspects,推进了虚拟助手、游戏和交互式数字媒体的能力。
引用
@article{arxiv.2407.17430,
title = {A Comprehensive Review and Taxonomy of Audio-Visual Synchronization Techniques for Realistic Speech Animation},
author = {Jose Geraldo Fernandes and Sinval Nascimento and Daniel Dominguete and André Oliveira and Lucas Rotsen and Gabriel Souza and David Brochero and Luiz Facury and Mateus Vilela and Hebert Costa and Frederico Coelho and Antônio P. Braga},
journal= {arXiv preprint arXiv:2407.17430},
year = {2024}
}