中文

STONYBOOK:一个用于小说大规模分析的系统与资源

计算与语言 2023-11-08 v1

摘要

书籍历来是叙事传播的主要载体。我们开发了一套用于小说大规模分析的资源集合,包括:(1)一个开源端到端 NLP 分析流水线,用于将小说标注为标准 XML 格式;(2)一个包含 49,207 部不同已清洗与标注小说的集合;(3)一个带有相关网页界面的数据库,用于对这些文学作品进行大规模聚合分析。我们描述了标注系统提供的主要功能及其用途。我们展示了来自网站的分析产物样例,例如人物出现与互动可视化、相似书籍、代表性词汇、词性统计以及可读性指标。我们还描述了该标注格式在大型小说语料库定性与定量分析中的使用。

关键词

引用

@article{arxiv.2311.03614,
  title  = {STONYBOOK: A System and Resource for Large-Scale Analysis of Novels},
  author = {Charuta Pethe and Allen Kim and Rajesh Prabhakar and Tanzir Pial and Steven Skiena},
  journal= {arXiv preprint arXiv:2311.03614},
  year   = {2023}
}

备注

8 pages, 12 figures