计算主题学:文学小说体裁聚类的算法比较
计算与语言
2023-05-22 v1
摘要
捕捉文学文本间主题相似性的最佳方法是什么?知晓此问题的答案将有助于书籍体裁或任何其他主题分组的自动聚类。本文比较了多种用于文本间主题相似性无监督学习的算法,我们称之为“计算主题学”。这些算法属于三个分析步骤:文本预处理、文本特征提取以及特征列表间距离度量。每个步骤包含多种选项。我们测试了这些选项的所有可能组合:每种算法组合都被赋予一项任务,即对属于四种预标注小说体裁的语料库进行聚类。随后根据该“真实”体裁标签对聚类进行验证。这种算法比较使我们了解到计算主题分析中最优与最差的算法组合。为说明最优与最差方法间的显著差异,我们随后对来自 HathiTrust 小说语料库的 5000 部随机小说进行聚类。
引用
@article{arxiv.2305.11251,
title = {Computational thematics: Comparing algorithms for clustering the genres of literary fiction},
author = {Oleg Sobchuk and Artjoms Šeļa},
journal= {arXiv preprint arXiv:2305.11251},
year = {2023}
}