关于前古典希腊语文本错误的注释数据集及检测基线
计算与语言
2025-04-02 v2
摘要
随着古籍历经数个世纪的传传承,错误不可避免地会逐渐积累。这些错误往往难以识别,因为某些错误已经存活了这么久,恰恰是因为它们如此隐蔽。虽然先前的研究在人工生成的错误上评估了错误检测方法,但我们引入了首个真实存在的前古典希腊语错误数据集,使我们能够评估在历经多个世纪真实积累的错误上进行的错误检测方法。为创建此数据集,我们利用BERT条件概率派生的指标,对1000个更可能包含错误的单词进行抽样,然后由领域专家标注为错误或非错误。我们随后提出并评估了新的错误检测方法,发现基于判别器的检测器在分类真实错误方面优于所有其他方法,提高了5%的真阳性率。此外,我们还观察到手抄错误比印刷或数字化错误更难检测。我们的数据集首次使人们能够在真实的前古典文本错误上评估错误检测方法,为开发更有效的错误检测算法提供了基准,帮助学者们恢复古代作品。
关键词
引用
@article{arxiv.2410.11071,
title = {An Annotated Dataset of Errors in Premodern Greek and Baselines for Detecting Them},
author = {Creston Brooks and Johannes Haubold and Charlie Cowen-Breen and Jay White and Desmond DeVaul and Frederick Riemenschneider and Karthik Narasimhan and Barbara Graziosi},
journal= {arXiv preprint arXiv:2410.11071},
year = {2025}
}