基于语言模型方法在地方志中挖掘与发现传记信息
计算与语言
2015-04-10 v1 计算机与社会
数字图书馆
摘要
我们展示了通过文本挖掘历史地方志(difangzhi)来扩展中国传记数据库(China Biographical Database)内容的结果。该数据库的目标是通过亲属关系、社会联系以及人们任职的地点和官职,来观察人们如何相互连接。地方志是覆盖宋至清时期最重要的姓名与官职集合。尽管我们从地方官员开始,但最终将纳入地方科举考生名单、在当地政府任职的人员以及有传记的当地知名人物。我们收集的数据越多,涌现的联系就越多。开展系统性文本挖掘工作的价值在于,我们能够识别直接或间接有用而无需深度历史研究的相关联系。中央研究院(Academia Sinica)正在开发明清中央政府官员姓名数据库。
引用
@article{arxiv.1504.02148,
title = {Mining and discovering biographical information in Difangzhi with a language-model-based approach},
author = {Peter K. Bol and Chao-Lin Liu and Hongsu Wang},
journal= {arXiv preprint arXiv:1504.02148},
year = {2015}
}
备注
6 pages, 4 figures, 1 table, 2015 International Conference on Digital Humanities. in Proceedings of the 2015 International Conference on Digital Humanities (DH 2015). July 2015