Amphion:一个开源的音频、音乐和语音生成工具包
声音
2024-09-17 v3 音频与语音处理
摘要
Amphion 是一个用于音频、音乐和语音生成的开源工具包,旨在为初级研究人员和工程师进入这些领域提供便利。它提供了一个统一的框架,包含多样化的生成任务和模型,并具有易于扩展以纳入新内容的额外优势。该工具包设计了适合初学者使用的工作流程和预训练模型,使初学者和经验丰富的研究人员都能相对轻松地启动他们的项目。Amphion v0.1 的初始版本支持一系列任务,包括文本转语音(TTS)、文本转音频(TTA)和歌声转换(SVC),并辅以数据预处理、SOTA 声码器和评估指标等基本组件。本文对 Amphion 进行了高层次概述。Amphion 已在 https://github.com/open-mmlab/Amphion 开源。
引用
@article{arxiv.2312.09911,
title = {Amphion: An Open-Source Audio, Music and Speech Generation Toolkit},
author = {Xueyao Zhang and Liumeng Xue and Yicheng Gu and Yuancheng Wang and Jiaqi Li and Haorui He and Chaoren Wang and Songting Liu and Xi Chen and Junan Zhang and Zihao Fang and Haopeng Chen and Tze Ying Tang and Lexiao Zou and Mingxuan Wang and Jun Han and Kai Chen and Haizhou Li and Zhizheng Wu},
journal= {arXiv preprint arXiv:2312.09911},
year = {2024}
}
备注
Accepted by IEEE SLT 2024