音频合成与音视频多模态处理综述
音频与语音处理
2021-08-03 v1 声音
摘要
随着深度学习和人工智能的发展,音频合成在机器学习领域发挥着关键作用,并在工业界展现出很强的适用性。同时,目前研究人员已投入大量精力处理音视频多模态处理等多模态任务。本文对音频合成与音视频多模态处理进行了综述,有助于理解当前研究与未来趋势。本综述聚焦于语音合成(TTS)、音乐生成以及一些融合视觉与声学信息的任务。我们对相应的技术方法进行了全面分类与介绍,并展望了其未来发展趋势。本综述可为对音频合成与音视频多模态处理等领域感兴趣的研究人员提供一定指导。
引用
@article{arxiv.2108.00443,
title = {A Survey on Audio Synthesis and Audio-Visual Multimodal Processing},
author = {Zhaofeng Shi},
journal= {arXiv preprint arXiv:2108.00443},
year = {2021}
}