面向非标准录音环境的基于谱转变测度的鲁棒音素分割
音频与语音处理
2020-05-01 v1 声音
摘要
误发音的音素级定位是自动发音错误评估系统的关键需求。一个鲁棒的音素分割技术对于辅助语音音素级误发音的实时评估至关重要,其中音频通过手机或平板录制。这是一种非标准录音设置,对录音质量几乎无法控制。我们提出一种新颖的后处理技术,以在噪声环境与削波等常见于手机录音的噪声条件下,辅助基于谱转变测度(STM)的音素分割。我们展示了本方法与使用传统 MFCC 和 PLPCC 语音特征进行高斯噪声与削波下音素分割的性能比较。所提方法在 TIMIT 与印地语语音语料库上进行了验证,并用于计算一组语音的音素边界,该组语音同时在三种设备上录制——一台笔记本、一台固定放置的平板与一台手持手机,以模拟实时非标准录音环境中的不同音频质量。F-ratio 是用于计算音素边界标记准确度的度量。实验结果显示,相较基线方法,TIMIT 提升 7%,印地语数据提升 10%。在内部收集的三设备录音集上也观察到类似结果。
引用
@article{arxiv.2004.14859,
title = {Robust Phonetic Segmentation Using Spectral Transition measure for Non-Standard Recording Environments},
author = {Bhavik Vachhani and Chitralekha Bhat and Sunil Kopparapu},
journal= {arXiv preprint arXiv:2004.14859},
year = {2020}
}
备注
6 pages, 6 figures