中文

特定领域可比语料库基于术语度的可比性度量

计算与语言 2013-02-20 v1

摘要

跨语言信息检索 (CLIR) 和机器翻译 (MT) 资源(如词典和平行语料库)在特定领域十分稀缺且难以获取。此外,这些资源仅限于少数几种语言,如英语、法语和西班牙语等。因此,自动获取此类领域的可比语料库可以有效地解决这一问题。可比语料库(其子语料库彼此并非翻译关系)可以很容易地从网络获取。因此,构建和使用可比语料库通常是多语言信息处理中更可行的选择。可比性度量是构建和使用可比语料库领域的关键问题之一。目前,对于语料库可比性尚无广泛接受的定义或度量方法。事实上,可能会给出不同的可比性定义或度量方法以适应各种自然语言处理任务。本文提出了一种新的可比性度量,即面向双语术语抽取任务的基于术语度 (termhood) 的度量。在该方法中,单词按术语度而非频率进行排序,然后基于单词术语度排序列表计算的余弦相似度被用作可比性。实验结果表明,基于术语度的度量优于传统的基于频率的度量。

关键词

引用

@article{arxiv.1302.4489,
  title  = {Termhood-based Comparability Metrics of Comparable Corpus in Special Domain},
  author = {Sa Liu and Chengzhi Zhang},
  journal= {arXiv preprint arXiv:1302.4489},
  year   = {2013}
}