中文

Confusion2vec 2.0:以子词丰富歧义口语表征

计算与语言 2022-05-04 v2 声音 音频与语音处理

摘要

词向量表征使机器能够编码人类语言以用于口语理解与处理。Confusion2vec受人类语音产生与感知的启发,是一种除语义与句法信息外还编码人类口语中存在的歧义的词向量表征。Confusion2vec通过考虑固有的人类语言歧义提供了鲁棒的口语表征。本文中,我们提出一种新颖的词向量空间估计方法,通过对自动语音识别(ASR)系统输出的格进行无监督学习得到。我们以构成词的子词字符n-gram在confusion2vec向量空间中编码每个词。我们表明子词编码借助基于格结构ASR输出建模的信息,有助于更好地表征人类口语中的声学感知歧义。所提Confusion2vec表征的有用性通过语义、句法及声学类比和词相似度任务进行评估。我们还展示了子词建模在口语意图检测任务中对声学歧义表征的益处。当在含错的ASR输出上评估时,结果显著优于现有词向量表征。我们证明Confusion2vec子词建模消除了在ASR转写上重新训练/适配自然语言理解模型的需要。

关键词

引用

@article{arxiv.2102.02270,
  title  = {Confusion2vec 2.0: Enriching Ambiguous Spoken Language Representations with Subwords},
  author = {Prashanth Gurunath Shivakumar and Panayiotis Georgiou and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2102.02270},
  year   = {2022}
}