检测新词义:西班牙语中词嵌入模型的比较
计算与语言
2020-01-16 v1
摘要
语义新词(SN)定义为保持形式不变但获得新词义的词语。鉴于此类新词的性质,识别这些新词义的任务目前由新词观察机构的专家手动完成。为以半自动方式检测 SN,我们开发了一个系统,实现了以下策略的组合:主题建模、关键词抽取和词义消歧。主题建模的作用是检测输入文本中所处理的主题。文本中的主题为所用词语的特定含义提供线索,例如:viral 在计算机科学(CS)语境中有一种含义,而在谈论健康时有另一种含义。为抽取关键词,我们使用带词性标签过滤的 TextRank。通过此方法,我们可获得已成为西班牙语词汇一部分的相关词语。我们使用深度学习模型来判断给定关键词是否可能具有新含义。与所有已知含义(或主题)不同的嵌入表明一个词可能是有效的 SN 候选。在本研究中,我们考察了以下词嵌入模型:Word2Vec、Sense2Vec 和 FastText。这些模型使用西班牙语维基百科作为语料库以等价参数训练。随后我们使用从我们的新词数据库中获取的词表及其语境共现来展示各模型产生的不同嵌入。最后,我们将这些结果与每个词的共现进行比较,以展示我们如何判定一个词是否可能为 SN 的有效候选。
引用
@article{arxiv.2001.05285,
title = {Detecting New Word Meanings: A Comparison of Word Embedding Models in Spanish},
author = {Andrés Torres-Rivera and Juan-Manuel Torres-Moreno},
journal= {arXiv preprint arXiv:2001.05285},
year = {2020}
}
备注
16 pages, 3 figures