英语诗歌语料库中的探索:神经认知诗学视角
计算与语言
2018-01-09 v1
摘要
本文描述了一个约含3000篇英语文学文本、逾2.5亿词、提取自Gutenberg计划的语料库,涵盖由130余位作者(如Darwin、Dickens、Shakespeare)所写的虚构与非虚构多种体裁。采用定量叙事分析(QNA)探索清洗后的子语料库——Gutenberg英语诗歌语料库(GEPC),其包含50余位作者(如Keats、Joyce、Wordsworth)的100余篇诗歌文本,约200万词。若干示例QNA研究展示了基于潜在语义分析作者相似性、各位作者的显著主题,以及针对George Eliot的诗作'How Lisa Loved the King'与James Joyce的'Chamber Music'的多种文本分析度量,涉及如词汇多样性或情感分析。GEPC特别适用于数字人文、自然语言处理或神经认知诗学的研究,例如作为训练与测试语料库,或用于刺激材料的开发与控制。
引用
@article{arxiv.1801.02054,
title = {Explorations in an English Poetry Corpus: A Neurocognitive Poetics Perspective},
author = {Arthur M. Jacobs},
journal= {arXiv preprint arXiv:1801.02054},
year = {2018}
}
备注
27 pages, 4 figures