中文

大型希伯来语/阿拉姆语语料库中平行段落的识别

计算与语言 2023-06-22 v2

摘要

我们提出一种方法,用于高效查找大型语料库中的所有平行段落,即使这些段落由于改写和正字法变体而不完全等同。关键思想是将语料库中每个词用其两个最不频繁的字母表示,找出由四或五个词组成的字符串中至多差一个词的匹配对,然后识别此类匹配对的簇。使用该方法,在包含超过180万词的希伯来-阿拉姆语料《巴比伦塔木德》中,仅用30余秒便识别出超过4600对平行段落。在样本数据上的经验比较表明,我们的方法所获得的覆盖率与缓慢的穷举方法基本相同。

关键词

引用

@article{arxiv.1602.08715,
  title  = {Identification of Parallel Passages Across a Large Hebrew/Aramaic Corpus},
  author = {Avi Shmidman and Moshe Koppel and Ely Porat},
  journal= {arXiv preprint arXiv:1602.08715},
  year   = {2023}
}

备注

Submission to the Journal of Data Mining and Digital Humanities (Special Issue on Computer-Aided Processing of Intertextuality in Ancient Languages)