中文

中国正史语料库:跨越两千年的性别分析

计算与语言 2020-05-19 v1

摘要

中国正史构成了从公元前 3 世纪到公元 18 世纪约 2000 年的大型连续语言空间。这些史书以文言(文学汉语)记载于超过两千万字的语料库中,适用于历史词汇与语义变化的计量分析。然而,目前尚无自由可用的开源正史语料库,使得文言文成为低资源语言。本项目引入一个采用知识共享许可的二十四史开源语料库。我们编制了一份原创的文言性别特定词表,作为分析男女用语历史使用的案例研究。该研究表明这些词的使用具有相当的稳定性,且男性词占主导。词义探索采用为性别特定词创建的聚焦语料库的关键词分析。该方法产生了有意义的语义表示,可用于未来的历时语义研究。

关键词

引用

@article{arxiv.2005.08793,
  title  = {Corpus of Chinese Dynastic Histories: Gender Analysis over Two Millennia},
  author = {Sergey Zinin and Yang Xu},
  journal= {arXiv preprint arXiv:2005.08793},
  year   = {2020}
}

备注

12th Conference on Language Resources and Evaluation (LREC 2020), 9 pages, 7 tables