圣经希伯来文的语义平行检测: 基于Transformer的基准
计算与语言
2025-07-02 v2
摘要
识别圣经希伯来文(BH)中的平行段落是圣经学研究理解语义关系的核心。传统方法依赖人工比较,过程繁琐且易出错。本研究评估了预训练变换模型(包括E5、AlephBERT、MPNet和LaBSE)用于检测希伯来圣经中文本平行的潜力。聚焦于Samuel/Kings与Chronicles之间的已知平行,我评估了每个模型生成的词嵌入在区分平行与非平行段落方面的能力。使用余弦相似性和Wasserstein距离测度,我发现E5和AlephBERT表现突出;E5在平行检测方面卓越,而AlephBERT在非平行区分方面更强。这些发现表明,预训练模型可提高古代文本中语义平行检测的效率和准确性,为古语言研究的更广泛应用指明了方向。
关键词
引用
@article{arxiv.2506.24117,
title = {Intertextual Parallel Detection in Biblical Hebrew: A Transformer-Based Benchmark},
author = {David M. Smiley},
journal= {arXiv preprint arXiv:2506.24117},
year = {2025}
}