中文

Confusion2Vec:以表征模糊性丰富词向量空间表示

计算与语言 2019-07-01 v2

摘要

词向量表示是自然语言处理(NLP)与人机交互中的关键部分。本文受人类语音产生与感知的启发,提出一种新颖的词向量表示 Confusion2Vec,其编码了表征模糊性。人类同时利用声学相似线索与上下文线索来解码信息,我们聚焦于一种融合这两类信息的模型。声学的表征模糊性表现为词混淆,人类与机器常通过上下文线索加以消解。除声学感知外,各类领域(如形态变换、面向机器翻译等 NLP 任务的释义)中均可能出现多种表征模糊性。本工作中,我们以自动语音识别(ASR)中的应用为例进行研究,其中词混淆与声学相似性相关。我们提出若干技术来训练声学感知相似性表征模糊性。我们称之为 Confusion2Vec,并基于 ASR 混淆网络或类格结构中的无监督生成数据进行学习。除语义-句法与词相似性评测外,我们还制定了适用于 Confusion2Vec 的评测以衡量声学相似性。Confusion2Vec 能够高效建模词混淆,且不损害语义-句法词关系,从而以额外的任务相关模糊信息有效丰富了词向量空间。我们利用嵌入的主成分分析对二维 Confusion2Vec 空间进行直观探索,并将其与语义、句法及声学关系相联系。通过涉及 ASR 纠错的小型示例,展示了 Confusion2Vec 在利用格中不确定性方面的潜力。

关键词

引用

@article{arxiv.1811.03199,
  title  = {Confusion2Vec: Towards Enriching Vector Space Word Representations with Representational Ambiguities},
  author = {Prashanth Gurunath Shivakumar and Panayiotis Georgiou},
  journal= {arXiv preprint arXiv:1811.03199},
  year   = {2019}
}