基于神经分析合成框架的歌手话语分析中的歌曲数据清洗
音频与语音处理
2024-06-25 v1 计算与语言
声音
摘要
我们提出了一种利用神经分析合成(NANSY++)框架进行数据清洗的方法,用于训练面向歌手话语分析的端到端神经话语分析模型(EEND)。我们提出的模型将包含合唱歌声的歌曲数据(这在流行音乐中常见且不适用于生成模拟数据集)转换为独唱歌声数据。这种清洗基于NANSY++,该框架旨在重建输入的非叠加音频信号。我们利用预训练的NANSY++将合唱歌声转换为干净、非叠加的音频。这种清洗过程缓解了将合唱歌声误标记为独唱歌声的问题,有助于即使在大多数可用歌曲数据包含合唱歌声部分的情况下,EEND模型也能有效训练。我们通过使用我们提出的方法构建的数据集进行实验评估,数据集来自标注好的流行双人合唱歌曲。结果表明,我们提出的方法将话语分析错误率降低了14.8分。
引用
@article{arxiv.2406.16315,
title = {Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework},
author = {Hokuto Munakata and Ryo Terashima and Yusuke Fujita},
journal= {arXiv preprint arXiv:2406.16315},
year = {2024}
}
备注
INTERSPEECH 2024 accepted