中文

That's sick dude!:跨时间尺度的词义变化自动识别

计算与语言 2014-05-20 v1 人工智能

摘要

本文提出了一种无监督方法,用于基于对数百万本数字化书籍形式提供的随时间变化的文本数据的严格分析,来识别名词词义的变化。我们根据不同时间点的数据构建基于分布同义词库的网络,并分别对它们进行聚类,以获得对应不同时间点的以词为中心的义项簇。随后,我们比较两个不同时间点的这些义项簇,以发现是否存在:(i) 新义项的产生;(ii) 旧义项分裂为多个义项;(iii) 新义项由旧义项合并而成;或 (iv) 特定义项的消亡。我们对所提出的方法进行了全面的手动评估以及与 WordNet 的对比评估。手动评估表明,该算法在 48 个随机选取的样本中能正确识别 60.4% 的新义项产生案例,在 21 个随机选取的样本中能正确识别 57% 的分裂/合并案例。值得注意的是,在 44% 的案例中,新义项的产生得到了 WordNet 的证实,而在 46% 和 43% 的案例中,分裂和合并分别得到了 WordNet 的确认。我们的方法可应用于词典编纂,以及词义消歧或语义搜索等应用。

关键词

引用

@article{arxiv.1405.4392,
  title  = {That's sick dude!: Automatic identification of word sense change across different timescales},
  author = {Sunny Mitra and Ritwik Mitra and Martin Riedl and Chris Biemann and Animesh Mukherjee and Pawan Goyal},
  journal= {arXiv preprint arXiv:1405.4392},
  year   = {2014}
}

备注

10 pages, 2 figures, ACL-2014