中文

时空中的手稿:基于古法语语料库的笔迹计量实验

计算与语言 2018-02-06 v1 应用统计

摘要

以手稿形式保存的中世纪文学文本见证物是分层的对象,几乎 exclusively 为副本的副本。这导致多重且难以区分的语言层——作者的 scripta 与不同抄写员的 scriptae 相互作用——而在文学书面语已是方言混合体的语境中。此外,单一语言现象无法区分不同 scriptae,只有多种特征的组合才可能显著[9]——但哪些是?最常见的方法是在一组先前选定的、假定代表特定 scripta 的文本中搜索这些特征。这可能引发循环:用文本选取特征,而这些特征转而将它们刻画为属于某一语言区域。为应对此问题,本文提供一种无监督且基于语料库的方法,将聚类方法应用于古法语语料库以识别主要划分与群组。最终,为每一个构建笔迹计量轮廓。

关键词

引用

@article{arxiv.1802.01429,
  title  = {Manuscripts in Time and Space: Experiments in Scriptometrics on an Old French Corpus},
  author = {Jean-Baptiste Camps},
  journal= {arXiv preprint arXiv:1802.01429},
  year   = {2018}
}

备注

Andrew U. Frank; Christine Ivanovic; Francesco Mambrini; Marco Passarotti; Caroline Sporleder. Corpus-Based Research in the Humanities CRH-2, Jan 2018, Vienna, Austria. Available, online: https://www.oeaw.ac.at/fileadmin/subsites/academiaecorpora/PDF/CRH2.pdf