一种识别历时语料库中(相关)变化的完全数据驱动方法
计算与语言
2015-08-28 v2 信息检索
应用统计
摘要
本文改编并扩展了 Kilgarriff (2001) 提出的一种测量共时语料库(非)相似性的方法,以识别历时文本数据中的趋势和相关变化,使用了美国历史英语语料库(Davies 2010a)和 Google Ngram 语料库(Michel et al. 2010a)。本文表明,这种完全数据驱动的方法提取在给定时期内频率发生最显著变化的词型,其计算成本非常低,并且允许对历时趋势进行既直观合理又从信息论角度有充分动机的解释。此外,它证明了该方法能够识别可与历史事件相关联的相关语言变化和历时转变。最后,它可以帮助改进历时词性标注并补充现有的 NLP 方法。这表明该方法可以促进对语言变化中历时过程的更好理解。
引用
@article{arxiv.1508.06374,
title = {A fully data-driven method to identify (correlated) changes in diachronic corpora},
author = {Alexander Koplenig},
journal= {arXiv preprint arXiv:1508.06374},
year = {2015}
}
备注
typological changes only: reference-source-not-found-errors removed