中文

Roget 词典作为自然语言处理的词汇资源

计算与语言 2012-04-03 v1

摘要

WordNet 证明了基于词汇语义学原理构建大规模电子词汇数据库是可行的。自发布以来,它已被计算语言学家广泛接受和使用。受 WordNet 成功的启发,我们提出一种基于 1987 年 Penguin 版《Roget 英语词词库》的类似资源作为替代。Peter Mark Roget 在 150 多年前出版了其第一版词库。无数作家、演说家和英语学习者曾使用过它。计算语言学家在自然语言处理中使用 Roget 词典已有近 50 年,但由于缺乏合适的机器可处理版本,对接受 Roget 词典一直有所犹豫。本论文提出了 1987 年 Penguin 版 Roget 词典机器可处理版本的一个实现——这是首个使用完整现行版本的此类实现。论文阐述了将机器可读文件转化为可处理系统所需的步骤,包括将词汇材料转换为更易于利用的格式、识别数据结构以及设计类以实现词库的计算机化。本文详细研究了 Roget 的组织结构,并与 WordNet 进行了对比。我们展示了计算机化词库的两个应用:计算词和短语的语义相似度,以及在文本中构建词汇链。实验使用著名的基准数据集进行,结果与其他使用 Roget 词典、WordNet 和统计技术的系统进行了比较。结果表明,Roget 词典是度量语义相似度的优秀资源;词汇链易于构建但难以评估。我们还阐述了将 Roget 词典与 WordNet 结合使用的方法。

关键词

引用

@article{arxiv.1204.0140,
  title  = {Roget's Thesaurus as a Lexical Resource for Natural Language Processing},
  author = {Mario Jarmasz},
  journal= {arXiv preprint arXiv:1204.0140},
  year   = {2012}
}

备注

Thesis submitted to the Faculty of Graduate and Postdoctoral Studies in partial fulfillment of the requirements for the degree of Master of Computer Science July, 2003. Ottawa-Carleton Institute for Computer Science, School of Information Technology and Engineering, University of Ottawa, Ottawa, Ontario, Canada