面向莎士比亚戏剧持续分析的数据科学与机器学习方法
计算与语言
2024-02-14 v3 机器学习
摘要
定量文本分析方法的可用性,为以前信息时代无法实现的方式分析文学提供了新途径。在此,我们将全面的机器学习分析应用于 William Shakespeare 的作品。分析表明,写作风格随时间发生了明显变化,其中最显著的变化体现在句子长度、形容词和副词的频率以及文本中表达的情感上。应用机器学习对戏剧年份进行计量文体学预测,显示实际年份与预测年份之间的 Pearson 相关系数为 0.71,表明 Shakespeare 的写作风格(如定量测量所反映)随时间发生了变化。此外,分析还表明,某些戏剧的计量文体学特征更类似于在其创作年份之前或之后写成的戏剧。例如,《Romeo and Juliet》定年为 1596 年,但在计量文体学上更类似于 Shakespeare 在 1600 年之后写成的戏剧。分析源代码可供免费下载。
引用
@article{arxiv.2301.06024,
title = {A data science and machine learning approach to continuous analysis of Shakespeare's plays},
author = {Charles Swisher and Lior Shamir},
journal= {arXiv preprint arXiv:2301.06024},
year = {2024}
}
备注
Journal of Data Mining and Digital Humanities, accepted