中文

面向零样多语言口语关键词识别的语言通用语音属性建模

机器学习 2024-06-06 v2

摘要

我们提出了一种新颖的语言通用方法,用于端到端自动口语关键词识别(Spoken Keyword Recognition, SKR),基于(i)自监督预训练模型,和(ii)一组通用语音属性(语音方式和咬唇位置)。具体而言,使用 Wav2Vec2.0 生成稳健的语音表示,随后通过一个线性输出层产生属性序列。随后使用一个非可训练的发音模型将属性序列映射到多语言语境下的口语关键词。在 Multilingual Spoken Words Corpus 上的实验表明,该方法在已见语言上的性能与基于字符和音素的 SKR 相当。引入域对抗训练(Domain Adversarial Training, DAT)后,该框架的性能得到提升,分别在已见语言上超越基于字符和音素的 SKR 方法,实现了13.73% 和 17.22% 的相对词错误率(Word Error Rate, WER)降低;在零样设置下,针对未见语言实现了32.14% 和 19.92% 的 WER 降低。

关键词

引用

@article{arxiv.2406.02486,
  title  = {A Temporal Kolmogorov-Arnold Transformer for Time Series Forecasting},
  author = {Remi Genet and Hugo Inzirillo},
  journal= {arXiv preprint arXiv:2406.02486},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2405.07344