丝绒噪声的频域变体及其在语音处理与合成中的应用(含附录)
声音
2018-07-06 v1 音频与语音处理
信号处理
摘要
我们提出一种用于声码器(VOCODER)的新激励源信号,以及一种用于合成声音后处理与自然声音预处理以增强数据的全通冲激响应。所提信号为丝绒噪声的变体,丝绒噪声是一种稀疏离散信号,由少量非零(1 或 -1)元素组成,且听感比高斯白噪声更平滑。所提变体之一 FVN(频域丝绒噪声)在 DFT(离散傅里叶变换)的循环频域上应用生成丝绒噪声的过程。随后,通过平滑所生成信号来设计全通滤波器的相位,再经逆傅里叶变换得到所提 FVN。由冻结与打乱随机数生成的 FVN 的时变频率加权混合提供了一种统一激励信号,可涵盖从随机噪声到重复脉冲序列的范围。另一变体为一种全通冲激响应,通过滤波显著减少声码器输出的“嗡嗡”感。最后,我们将讨论所提信号在水印与心理声学研究中的应用。
引用
@article{arxiv.1806.06812,
title = {Frequency domain variants of velvet noise and their application to speech processing and synthesis: with appendices},
author = {Hideki Kawahara and Ken-Ichi Sakakibara and Masanori Morise and Hideki Banno and Tomoki Toda and Toshio Irino},
journal= {arXiv preprint arXiv:1806.06812},
year = {2018}
}
备注
11 pages, 20 figures, and 1 table, Interspeech 2018