利用机器学习分析拉丁文写作风格:旧问题的新路径
计算与语言
2021-09-03 v1
摘要
在中世纪,文本被熟记于心,并通过口头交流方式代代相传。散文与诗歌艺术的调适使得许多文学体裁特有的描述与构图得以保存。考虑到以拉丁文写就的文学此类特殊建构,我们可搜寻并指出特定叙事文本熟悉来源的概率模式。借助自然语言处理工具,我们能将文本对象转化为数值对象,进而应用机器学习算法从数据集中提取信息。我们执行了一项任务,包括实际运用这些概念与观察,以基于开源数据库创建一个分析叙事文本的工具。该工具侧重于创建特定的搜索工具资源,使我们能对文本进行详细检索。研究的主要目标包括寻找句子之间与文档之间的相似性。接着,我们在选定文本上应用机器学习算法以计算其具体特征(例如作者身份或世纪),并以一定百分比识别匿名文本的来源。
引用
@article{arxiv.2109.00601,
title = {Latin writing styles analysis with Machine Learning: New approach to old questions},
author = {Arianna Di Bernardo and Simone Poetto and Pietro Sillano and Beatrice Villata and Weronika Sójka and Zofia Piętka-Danilewicz and Piotr Pranke},
journal= {arXiv preprint arXiv:2109.00601},
year = {2021}
}
备注
12 pages, 6 figures