NHSS:一种语音与歌唱并行数据库
声音
2021-08-06 v2 人机交互
音频与语音处理
摘要
我们提出了一个由新加坡国立大学(NUS)人类语言技术(HLT)实验室收集并发布的语音与歌唱并行录音数据库,称为NUS-HLT Speak-Sing(NHSS)数据库。我们向公众发布该数据库以支持研究活动,包括但不限于语音与歌唱信号声学属性的比较研究、语音与歌唱声音的合作合成,以及语音到歌唱的转换。该数据库包含英文流行歌曲的演唱人声录音、演唱者以其自然阅读方式朗读的歌曲歌词对应口语录音,以及人工准备的语句级和词级标注。NHSS数据库中的音频录音对应于10名歌手演唱和朗读的100首歌曲,共计7小时音频数据。其中有5名男歌手和5名女歌手,每人演唱并朗读10首歌曲的歌词。本文中,我们讨论了该数据库的设计方法,分析了语音与歌唱声音特征的相似与差异,并提供了一些策略以应对这些特征之间的关系从而实现相互转换。我们开发了基准系统,可作为使用NHSS数据库进行语音到歌唱对齐、频谱映射和转换的参考。
引用
@article{arxiv.2012.00337,
title = {NHSS: A Speech and Singing Parallel Database},
author = {Bidisha Sharma and Xiaoxue Gao and Karthika Vijayan and Xiaohai Tian and Haizhou Li},
journal= {arXiv preprint arXiv:2012.00337},
year = {2021}
}
备注
Accepted to Speech Communication