基于词向量组合模型构建语言演化树
计算与语言
2018-10-09 v1 机器学习
机器学习
摘要
在本文中,我们尝试通过案例计算来探索语言的演化。首先,我们选取了 1400 年至 2005 年间十一位英国作家的小说并找到相应作品;接着,我们使用自然语言处理工具构建对应的十一个语料库,并计算十一个语料库中各自 100 个高频词的词向量;接下来,对于每个语料库,我们将这 100 个词向量从头到尾拼接为一个;最后,我们使用相似性比较与层次聚类方法生成拼接后的十一个词向量之间的关系树。该树表示了十一个语料库之间的关系。我们发现,在聚类生成的树中,语料库与语料库对应年份之间的距离基本一致。这意味着我们发现了一种特定的语言演化树。为验证该方法的稳定性与通用性,我们加入了另外三个主题:狄更斯的八部作品、19 世纪诗人的作品,以及近 60 年的艺术批评。针对这四个主题,我们测试了语料时间跨度、语料间时间间隔、词向量维度以及高频公共词数量等不同参数。结果表明该方法具有相当的稳定性与通用性。
引用
@article{arxiv.1810.03445,
title = {Building a language evolution tree based on word vector combination model},
author = {Zhu Gao and Yanhui Jiang and Junhui Gao},
journal= {arXiv preprint arXiv:1810.03445},
year = {2018}
}