FALL-E:一种拟音声音合成模型及其策略
音频与语音处理
2023-08-11 v2 机器学习
声音
摘要
本文介绍了 FALL-E,一个拟音合成系统及其训练/推理策略。FALL-E 模型采用级联方法,包括低分辨率频谱图生成、频谱图超分辨率和声码器。我们使用大规模数据集从头训练了每个与声音相关的模型,并利用了预训练语言模型。我们用数据集特定的文本对模型进行条件化,使其能够根据文本输入学习声音质量与录音环境。此外,我们利用外部语言模型改进数据集的文本描述,并进行了提示工程以提升质量、连贯性与多样性。FALL-E 在 DCASE 2023 挑战赛任务 7 中通过客观指标和听音测试进行了评估。该提交在平均上获得第二名,同时在多样性上取得最佳分数,在音频质量上获得第二名,在类别契合度上获得第三名。
引用
@article{arxiv.2306.09807,
title = {FALL-E: A Foley Sound Synthesis Model and Strategies},
author = {Minsung Kang and Sangshin Oh and Hyeongi Moon and Kyungyun Lee and Ben Sangbae Chon},
journal= {arXiv preprint arXiv:2306.09807},
year = {2023}
}
备注
5 pages, 3 figures