探测语义类:诊断词嵌入的意义内容
计算与语言
2019-06-11 v1 机器学习
摘要
词嵌入通常将一词的不同含义表示在单个混合向量中。目前对歧义词嵌入的实证分析受限于人工标注资源的规模较小,以及词义被视为互不相关的独立概念这一事实。我们提出一个基于人工 Wikipedia 标注和词义的大规模数据集,其中不同词的词义通过语义类相互关联。这构成了对嵌入内容新颖诊断测试的基础:我们探测词嵌入中的语义类,并通过将嵌入分类为语义类来分析嵌入空间。我们的主要发现是:(i) 若某个词义频繁出现,其信息通常在单向量嵌入中得到良好表示。(ii) 仅基于词的嵌入,分类器即可准确预测该词是单义还是多义。(iii) 尽管罕见词义在单向量嵌入中未被良好表示,但这对性能依赖于频繁词义的 NLP 应用没有负面影响。
引用
@article{arxiv.1906.03608,
title = {Probing for Semantic Classes: Diagnosing the Meaning Content of Word Embeddings},
author = {Yadollah Yaghoobzadeh and Katharina Kann and Timothy J. Hazen and Eneko Agirre and Hinrich Schütze},
journal= {arXiv preprint arXiv:1906.03608},
year = {2019}
}
备注
14 pages, Accepted at ACL 2019