TokenSynth:基于token的神经音频合成器用于乐器克隆与文本到乐器
声音
2025-02-14 v1 人工智能
摘要
近期神经音频编解码器的进展,使token化音频表示得以在各种音频生成任务中应用,包括文本到语音、文本到音频和文本到音乐生成。基于这一方法,我们提出了TokenSynth,一种新型神经音频合成器,利用仅解码器的transformer从midi token 和CLAP(对比语言音频预训练)嵌入生成所需音频token,后者包含与时序相关信息。我们的模型能够在无需任何微调的情况下执行乐器克隆、文本到乐器合成和文本引导的时序控制。这一灵活性支持多样的声设计和直观的时序控制。我们使用客观指标评估了合成音频的质量、合成音频与目标音频/文本之间的时序相似性,以及合成准确性(即其是否准确跟随输入midi)。TokenSynth 展示了利用先进神经音频编解码器和transformer 创建强大且多功能神经音频合成器的潜力。源代码、模型权重和音频演示已公开于:https://github.com/KyungsuKim42/tokensynth。
引用
@article{arxiv.2502.08939,
title = {TokenSynth: A Token-based Neural Synthesizer for Instrument Cloning and Text-to-Instrument},
author = {Kyungsu Kim and Junghyun Koo and Sungho Lee and Haesun Joung and Kyogu Lee},
journal= {arXiv preprint arXiv:2502.08939},
year = {2025}
}
备注
5 pages, 1 figure, to be published in ICASSP 2025