通过词频分析的批判性圣经研究:揭示文本作者身份
计算与语言
2024-10-29 v1 机器学习
摘要
圣经是经历数个世纪口头-书面传递过程的产物,其早期版本的轮廓被掩盖了。关于确定现存层次、识别圣经文本的撰写日期以及历史背景的争论依旧激烈。传统的手动方法通过严谨的文本批评,运用语言学、风格、内部圣经和历史标准来应对作者身份挑战。尽管近期在计算机辅助分析方面取得了进展,但许多模式仍需在圣经文本中被发现。在本研究中,我们通过对圣经文本中单词频率进行统计分析来回答圣经文本的作者身份问题,采用一种特别敏感于少数单词(在潜在众多单词中)频率偏差的方法。我们的目标是在大量章节中区分三个不同作者,这些章节跨越圣经前九本书。具体而言,我们检查 50 章节,依据圣经释义考虑划分为三个语料库(D、DtrH 和 P)。在对作者身份没有先验假设的前提下,我们的方法利用单词频率的细微差异来区分这三个语料库并识别作者相关的语言特征。我们的分析表明,前两个作者(D 和 DtrH)彼此关系更紧密,而 P 与之相对, 这与专家评估相符。此外,我们通过评估每章节与参考语料库的相似度,实现了对作者身份归属的高准确率。这项研究通过提供可解释且具有统计显著性的证据,揭示了圣经作者之间存在不同的语言特征,并且这些差异可以被识别。
引用
@article{arxiv.2410.19883,
title = {Critical biblical studies via word frequency analysis: unveiling text authorship},
author = {Shira Faigenbaum-Golovin and Alon Kipnis and Axel Bühler and Eli Piasetzky and Thomas Römer and Israel Finkelstein},
journal= {arXiv preprint arXiv:2410.19883},
year = {2024}
}