经典、非经典与非文学文本全局结构的比较计算分析
计算与语言
2021-04-19 v1
摘要
本研究考察文学与非文学文本的全局属性。在文学文本中,区分了经典与非经典作品。研究的核心假设是,三种文本类型(非文学、文学/经典与文学/非经典)在作为读者审美反应相关物的结构设计特征上表现出系统性差异。为考察这些差异,我们编撰了一个包含三类相关文本的语料库,即耶拿文本审美语料库(Jena Textual Aesthetics Corpus)。考察了全局结构的两个方面:变异性与自相似(分形)模式,它们反映了沿文本的长程关联。我们使用四类基本观测:(i) 每句词性标注频率,(ii) 句子长度,(iii) 文本块中的词汇多样性,以及 (iv) 文本块中主题概率的分布。这些基本观测被归为两个更一般的类别:(a) 低层属性 (i) 与 (ii),在句子层面观测(反映语言解码),以及 (b) 高层属性 (iii) 与 (iv),在文本层面观测(反映理解)。基本观测被转换为时间序列,并对这些时间序列进行多重分形去趋势波动分析(MFDFA)。我们的结果表明,在所分析的三种文本类型中,文本的低层属性比高层属性具有更好的区分能力。经典文学文本与非经典文学文本主要在变异性方面存在差异。分形性似乎是文本的普遍特征,在非文学文本中比在文学文本中更显著。除本研究的具体结果外,我们旨在为文本审美的实验研究开辟新视角。
引用
@article{arxiv.2008.10906,
title = {Comparative Computational Analysis of Global Structure in Canonical, Non-Canonical and Non-Literary Texts},
author = {Mahdi Mohseni and Volker Gast and Christoph Redies},
journal= {arXiv preprint arXiv:2008.10906},
year = {2021}
}
备注
30 pages + 7 pages supplementary material, 5 figures