基于时间卷积网络的起音检测与哼唱检索系统设计
声音
2023-06-09 v2 多媒体
音频与语音处理
摘要
起音是将音频分割为若干音符的关键因素。本文集成多个基于时间卷积网络(TCN)的模型,并利用受限频率范围频谱图以实现更鲁棒的起音检测。不同于现有仅适用于干净场景的哼唱检索(QBH)系统起音检测,我们所提出的起音检测与语音增强方案可防止噪声影响起音检测函数(ODF)。相较于利用频谱图空间特征的CNN模型,TCN模型同时利用了频谱图的空间与时间特征。鉴于QBH在噪声场景中的使用,我们将基于TCN的语音增强作为QBH的预处理模块。仿真表明,通过基于TCN的语音增强与起音检测相结合,所提方案可在噪声与干净环境下均以短响应时间赋能QBH系统。
引用
@article{arxiv.2305.05139,
title = {Temporal Convolution Network Based Onset Detection and Query by Humming System Design},
author = {Yu Cheng Hung and Jian-Jiun Ding},
journal= {arXiv preprint arXiv:2305.05139},
year = {2023}
}
备注
This paper has been withdrawn by the author due to a crucial definition of probability threshold and several grammer and vocabulary mistakes