中文

探测语义类:诊断词嵌入的意义内容

计算与语言 2019-06-11 v1 机器学习

摘要

词嵌入通常将一词的不同含义表示在单个混合向量中。目前对歧义词嵌入的实证分析受限于人工标注资源的规模较小,以及词义被视为互不相关的独立概念这一事实。我们提出一个基于人工 Wikipedia 标注和词义的大规模数据集,其中不同词的词义通过语义类相互关联。这构成了对嵌入内容新颖诊断测试的基础:我们探测词嵌入中的语义类,并通过将嵌入分类为语义类来分析嵌入空间。我们的主要发现是:(i) 若某个词义频繁出现,其信息通常在单向量嵌入中得到良好表示。(ii) 仅基于词的嵌入,分类器即可准确预测该词是单义还是多义。(iii) 尽管罕见词义在单向量嵌入中未被良好表示,但这对性能依赖于频繁词义的 NLP 应用没有负面影响。

关键词

引用

@article{arxiv.1906.03608,
  title  = {Probing for Semantic Classes: Diagnosing the Meaning Content of Word Embeddings},
  author = {Yadollah Yaghoobzadeh and Katharina Kann and Timothy J. Hazen and Eneko Agirre and Hinrich Schütze},
  journal= {arXiv preprint arXiv:1906.03608},
  year   = {2019}
}

备注

14 pages, Accepted at ACL 2019