中文

STRATA:基于迁移学习、注意力与数据增强的乌尔都语连续语音词边界与音素识别

计算与语言 2022-04-19 v1 声音 音频与语音处理

摘要

音素识别在自然语言处理中很大程度上仍未解决,尤其对于乌尔都语等低资源语言。那些试图从音频语音中提取音素的系统需要手工标注的音素转写。这需要专家语言学家以相关音素表示标注语音数据,既昂贵又繁琐。本文提出 STRATA,一种有监督音素识别框架,利用集成迁移学习、注意力机制与数据增强的 seq2seq 神经架构克服了低资源语言的数据稀缺问题。STRATA 采用迁移学习将网络损失减半。它使用注意力机制进行词边界与帧对齐检测,进一步将网络损失降低 4%,并能以 92.2% 的准确率识别词边界。STRATA 使用多种数据增强技术进一步将损失降低 1.5%,并且在泛化与准确率方面对新的信号更具鲁棒性。STRATA 实现了 16.5% 的音素错误率,并在 TIMIT 数据集(英语)上比最先进水平提升 1.1%,在 CSaLT 数据集(乌尔都语)上提升 11.5%。

关键词

引用

@article{arxiv.2204.07848,
  title  = {STRATA: Word Boundaries & Phoneme Recognition From Continuous Urdu Speech using Transfer Learning, Attention, & Data Augmentation},
  author = {Saad Naeem and Omer Beg},
  journal= {arXiv preprint arXiv:2204.07848},
  year   = {2022}
}