基于多任务音频源分离的语音与歌声联合识别
声音
2024-04-18 v1 音频与语音处理
摘要
在短视频和现场演播中,语音、歌声和背景音乐常常相互覆盖和遮蔽。这一复杂性给音频内容的结构化和识别带来了困难,可能损害后续的语音识别 (ASR) 和音乐理解应用。本文提出一种基于多任务音频源分离 (MTASS) 的语音识别模型,称为 JRSV,即 Jointly Recognizes Speech and singing Voices。具体而言,MTASS 模块将混合音频分离为 distinct 的语音和歌声轨道,同时消除背景音乐。CTC/注意力混合识别模块识别两个轨道。提出在线蒸馏以进一步提高识别鲁棒性。为评估所提方法,构建并发布了一个基准数据集。实验结果表明,JRSV 可显著提高混合音频每个轨道上的识别准确率。
引用
@article{arxiv.2404.11275,
title = {Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation},
author = {Ye Bai and Chenxing Li and Hao Li and Yuanyuan Zhao and Xiaorui Wang},
journal= {arXiv preprint arXiv:2404.11275},
year = {2024}
}
备注
Accepted by ICME 2024