中文

关于构建网络出版物平行双语语料库

计算与语言 2008-07-03 v1

摘要

本文提出了构建文本平行语料库的算法。该算法基于在文本文档中使用“关键词”及其自动翻译手段。关键词是通过使用俄语和乌克兰语形态学词典以及俄乌语言名词翻译词典提取的。此外,为了计算文档中术语的权重,使用了经验统计规则。所考虑的算法以程序综合体的形式实现,并集成到内容监控系统 InfoStream 中。结果构建了一个包含约 3 万份文档的网络出版物平行双语语料库。

关键词

引用

@article{arxiv.0807.0311,
  title  = {About the creation of a parallel bilingual corpora of web-publications},
  author = {D. V. Lande and V. V. Zhygalo},
  journal= {arXiv preprint arXiv:0807.0311},
  year   = {2008}
}

备注

3 pages