中文

历史手稿中改动类型的自动识别

机器学习 2020-11-05 v3 计算与语言 机器学习

摘要

信件等历史手稿中的改动是一个颇具前景的研究领域。一方面,它们有助于理解文本的构建过程。另一方面,若考虑改动(尤其是删除),在 manuscript 成稿时期被视为敏感的话题会获得连贯性与语境,特别是在删除的情况下。然而,手稿中改动的分析传统上是一项极为繁琐的工作。本文提出一种基于机器学习的方法来辅助对文档中的改动进行分类。具体而言,我们提出一个新的概率模型(下文称为 Alteration Latent Dirichlet Allocation,alterLDA),用于对内容相关的改动进行分类。此处提出的方法基于在数字学术版 Berlin Intellectuals 上开展的实验而开发,对于该版,alterLDA 在标注数据上的改动识别取得了高性能。在未标注数据上,应用 alterLDA 可带来关于作者、编辑及其他手稿贡献者的改动行为,以及约 1800 年前后柏林知识分子通信中敏感话题的新见解。除基于数字学术版 Berlin Intellectuals 的发现外,我们还提出一个用于文本生成分析的一般框架,可用于表示文档变体的其他数字资源语境中。为此,我们详细给出了为取得此类结果所应遵循的方法论步骤,从而提供了一个机器学习在数字人文(Digital Humanities)中应用的典范。

关键词

引用

@article{arxiv.2003.09136,
  title  = {Automatic Identification of Types of Alterations in Historical Manuscripts},
  author = {David Lassner and Anne Baillot and Sergej Dogadov and Klaus-Robert Müller and Shinichi Nakajima},
  journal= {arXiv preprint arXiv:2003.09136},
  year   = {2020}
}

备注

Accepted for publication in Digital Humanities Quarterly