中文

基于SSCF极坐标用于自动语音识别的初步研究

音频与语音处理 2022-12-05 v1 人工智能 机器学习 声音 信号处理

摘要

转移角被定义用于描述谱子带质心声学空间中元音到元音的转移,研究结果表明其在不同说话人与语速间具有相似性。本文提出研究使用极坐标而非角度来描述语音信号,通过刻画其声学轨迹并用于自动语音识别(Automatic Speech Recognition, ASR)。根据在BRAF100数据集上的实验结果,极坐标在混合与跨性别语音识别中取得了显著高于角度的准确率,表明这些表示在定义语音信号声学轨迹方面更优。此外,当将其与一阶和二阶差分(Δ\Delta, Δ\DeltaΔ\Delta)结合使用时,准确率显著提升,尤其在跨女性识别中。然而,结果显示其性别无关性并未明显优于传统的梅尔频率倒谱系数(Mel-frequency Cepstral Coefficients, MFCCs)。

关键词

引用

@article{arxiv.2212.01245,
  title  = {Preliminary Study on SSCF-derived Polar Coordinate for ASR},
  author = {Sotheara Leang and Eric Castelli and Dominique Vaufreydaz and Sethserey Sam},
  journal= {arXiv preprint arXiv:2212.01245},
  year   = {2022}
}