中文

汉典古代经典的主题建模

计算与语言 2017-02-06 v1 计算机与社会 数字图书馆 人机交互 信息检索

摘要

古代中文文本对于希望利用计算方法协助对具有文化意义的材料产生新见解与阐释的人文学者而言,是一个充满巨大挑战与机遇的领域。在本文中,我们描述了印第安纳大学与西安交通大学之间的一项合作努力,以支持对超过 18,000 篇古代中文文档的数字语料库进行探索与阐释,我们称之为“汉典”古代经典语料库(Hàn diǎn gǔ jí,即“汉典”或“中国经典”)。它包含中国古代哲学经典、具有历史与传记意义的文献以及文学作品。我们首先描述该联合项目的数字人文背景,以及使此项目可行的人文学计算进展。我们描述该语料库并介绍我们将概率主题建模应用于此语料库,关注对古代中文文档建模所带来的特殊挑战。我们给出一个具体示例,说明我们开发的软件如何可用于辅助发现与阐释语料库中的主题。我们概述了由我们的系统所提供的编程接口使之也成为可能的更先进的计算机辅助阐释形式,以及这些方法对于理解这些文本中意义本质的普遍启示。

关键词

引用

@article{arxiv.1702.00860,
  title  = {Topic Modeling the H\`an di\u{a}n Ancient Classics},
  author = {Colin Allen and Hongliang Luo and Jaimie Murdock and Jianghuai Pu and Xiaohong Wang and Yanjie Zhai and Kun Zhao},
  journal= {arXiv preprint arXiv:1702.00860},
  year   = {2017}
}

备注

24 pages; 14 pages supplemental