中文

利用全文内容刻画与识别畅销书

计算与语言 2023-05-12 v2 机器学习

摘要

艺术作品可从多个角度加以研究,其中一个例子是它们随时间在读者中的接受程度。在本文中,我们从文学作品的角度探讨这一有趣话题,特别评估了预测一本书是否会成为畅销书的任务。与以往方法不同,我们聚焦于书籍的全文内容,并考虑了可视化与分类任务。我们采用可视化对数据结构与性质进行初步探索,涉及 SemAxis 与线性判别分析。随后,为获得定量且更客观的结果,我们采用了多种分类器。这些方法与一个数据集结合使用,该数据集包含:(i) 1895 至 1924 年出版、并被《出版商周刊》畅销书榜认定为畅销书的书籍;(ii) 同一时期出版但未列入该榜单的文学作品。我们的方法比较显示,最佳结果——将词袋表示与逻辑回归分类器结合——在留一法与 10 折交叉验证中均达到了 0.75 的平均准确率。这一结果表明,仅利用文本全文内容难以高精度预测书籍的成功与否。尽管如此,我们的发现为导致文学作品相对成功的因素提供了见解。

关键词

引用

@article{arxiv.2210.02334,
  title  = {Using Full-Text Content to Characterize and Identify Best Seller Books},
  author = {Giovana D. da Silva and Filipi N. Silva and Henrique F. de Arruda and Bárbara C. e Souza and Luciano da F. Costa and Diego R. Amancio},
  journal= {arXiv preprint arXiv:2210.02334},
  year   = {2023}
}