基于 LSTM 的词义消歧:我们真的需要 1000 亿词吗?
计算与语言
2017-12-19 v2
摘要
近来,Yuan 等人(2016)展示了利用长短期记忆(LSTM)进行词义消歧(WSD)的有效性。他们所提出的技术在多个基准上优于先前的最先进方法,但既未发布训练数据也未发布源代码。本文给出了使用仅公开可用的数据集(GigaWord、SemCore、OMSTI)与软件(TensorFlow)对该技术进行复现研究的结果。由此发现,利用远少于 Yuan 等人暗示的数据量即可获得最先进的结果。所有代码与训练好的模型均自由公开。
引用
@article{arxiv.1712.03376,
title = {Word Sense Disambiguation with LSTM: Do We Really Need 100 Billion Words?},
author = {Minh Le and Marten Postma and Jacopo Urbani},
journal= {arXiv preprint arXiv:1712.03376},
year = {2017}
}