好书是复杂之物:衡量不同感知文学质量类别中的复杂性特征
计算与语言
2024-04-16 v2
摘要
在本研究中,我们采用分类方法表明,不同的文学“质量”类别展现出独特的语言特征,利用的语料库包括诺顿文选、企鹅经典系列和开放课程大纲项目中的书籍,并与当代畅销书、诺贝尔奖得主和著名文学奖项获得者进行对比。我们的分析显示,经典和所谓的高雅文本与其他质量类别(如畅销书和流行书籍)以及对照组相比,展现出不同的文本特征,可能对应于不同的(但非互斥的)质量模型。我们应用经典的机器学习方法——随机森林,来区分质量小说与“对照组”,在区分不同类别时达到了高达77%的F1分数。我们发现,质量类别往往比与其他质量类别更容易与对照组区分,这表明文学质量特征可能是可区分的,但通过质量代理共享。
引用
@article{arxiv.2404.04022,
title = {Good Books are Complex Matters: Gauging Complexity Profiles Across Diverse Categories of Perceived Literary Quality},
author = {Yuri Bizzoni and Pascale Feldkamp and Ida Marie Lassen and Mia Jacobsen and Mads Rosendahl Thomsen and Kristoffer Nielbo},
journal= {arXiv preprint arXiv:2404.04022},
year = {2024}
}