中文

AcrosticSleuth:多语料库中藏头诗的概率识别与排序

计算与语言 2024-08-09 v1

摘要

几个世纪以来,作者们一直以藏头诗的形式在文本中隐藏信息,即连续行或段落的首字母构成有意义的单词或短语。学者们手动搜索藏头诗时,一次只能关注少数几位作者,且往往倾向于定性论证其意图。我们旨在通过提出AcrosticSleuth,将藏头诗研究置于更坚实的统计基础之上。AcrosticSleuth是首个能够自动识别藏头诗,并根据字符序列非偶然出现的概率(因此可能是故意插入的)对其进行排序的工具。由于藏头诗十分罕见,我们将该问题形式化为一个存在极端类别不平衡的二元分类任务。为评估AcrosticSleuth,我们构建了藏头诗识别数据集(Acrostic Identification Dataset, AcrostID),该数据集收集自WikiSource在线数据库。尽管存在类别不平衡问题,AcrosticSleuth在WikiSource的法语、英语和俄语子域上分别取得了0.39、0.59和0.69的F1分数。我们进一步证明,AcrosticSleuth能够发现此前未知的高关注度文字游戏实例,例如意大利人文主义者阿尔贝蒂诺·穆萨托(Albertino Mussato)的藏头诗“ARSPOETICA”(“诗艺”)以及英国哲学家托马斯·霍布斯(Thomas Hobbes)在《法的要素》开篇段落中隐藏的藏头信息。

关键词

引用

@article{arxiv.2408.04427,
  title  = {AcrosticSleuth: Probabilistic Identification and Ranking of Acrostics in Multilingual Corpora},
  author = {Aleksandr Fedchin and Isabel Cooperman and Pramit Chaudhuri and Joseph P. Dexter},
  journal= {arXiv preprint arXiv:2408.04427},
  year   = {2024}
}