中文

基于例子的词义消歧中的选择性采样

计算与语言 2007-05-23 v1

摘要

本文提出一种用于基于例子的词义消歧系统的高效例子采样方法。为构建实用规模的数据库,需要可观的手动词义消歧开销(监督开销)。此外,搜索大规模数据库的时间复杂度也带来显著问题(搜索开销)。为应对这些问题,我们的方法从给定例子集中选择性采样一个规模更小且有效的子集,用于词义消歧。我们的方法特点在于依赖训练效用(training utility)这一概念:即每个例子用于系统训练时,对未来例子采样的信息量程度。系统通过选择效用最大的例子逐步收集。本文通过对约一千个句子的实验报告了方法的有效性。与其他例子采样方法的实验相比,我们的方法在系统性能不退化的情况下,同时降低了监督开销与搜索开销。

关键词

引用

@article{arxiv.cs/9910020,
  title  = {Selective Sampling for Example-based Word Sense Disambiguation},
  author = {Atsushi Fujii and Kentaro Inui and Takenobu Tokunaga and Hozumi Tanaka},
  journal= {arXiv preprint arXiv:cs/9910020},
  year   = {2007}
}

备注

25 pages, 14 Postscript figures