论现代汉语量词系统的特异性
计算与语言
2020-05-26 v3
摘要
尽管汉语量词系统的特异性一直是语言学家丰富研究的课题(Adams and Conklin, 1973; Erbaugh, 1986; Lakoff, 1986),但利用统计方法对其加以量化的工作尚不多见。本文中,我们引入一种信息论方法来度量特异性;我们考察通过知晓量词所修饰名词的语义信息,能在多大程度上降低现代汉语量词的不确定性。利用来自已解析中文Gigaword语料库(Graff et al., 2005)的量词经验分布,我们计算量词分布与其他语言量分布之间的互信息(以比特计)。我们探究名词和形容词的语义类在降低量词选择不确定性上的差异,发现其并非完全特异;尽管大多数语义类无明显趋势,形状名词对量词选择不确定性的降低最为显著。
引用
@article{arxiv.1902.10193,
title = {On the Idiosyncrasies of the Mandarin Chinese Classifier System},
author = {Shijia Liu and Hongyuan Mei and Adina Williams and Ryan Cotterell},
journal= {arXiv preprint arXiv:1902.10193},
year = {2020}
}