离散化对数正态分布与钩形幂律分布对引文数据是否合理?
数字图书馆
2016-03-17 v1
摘要
关于哪种统计分布最适合对引文计数数据进行建模,目前尚无共识。这一点很重要,因为如果接受某一种分布,就可以更全面地评估不同基于引文的指标(如百分位数、算术平均值和几何平均值)的相对优劣。为此,本文研究了偏移量为1的离散化对数正态分布和钩形幂律分布对全范围引文计数建模的合理性。我们将来自23个Scopus子类别的引文计数拟合到钩形幂律分布和离散化对数正态分布,但两种分布在超过四分之三的案例中均未通过Kolmogorov-Smirnov拟合优度检验。离散化对数正态分布对于引文分布似乎也具有错误的形状,对于所有学科而言,其零值太少而中等值不足。拟合不佳的原因可能是学科子类别的不纯性或跨学科研究的存在。尽管在理论上,通过足够大的样本量,可以通过拟合优度检验间接测试学科子类别的纯度,但在实践中可能无法实现。因此,似乎很难就理论上最合适的统计分布获得确凿证据。
引用
@article{arxiv.1603.05078,
title = {Are the discretised lognormal and hooked power law distributions plausible for citation data?},
author = {Mike Thelwall},
journal= {arXiv preprint arXiv:1603.05078},
year = {2016}
}
备注
Thelwall, M. (in press). Are the discretised lognormal and hooked power law distributions plausible for citation data? Journal of Informetrics