完整引文数据的离散对数正态分布与钩状幂律分布:建模与回归的最佳选择
数字图书馆
2016-03-07 v1
摘要
确定最贴合引文数据的统计分布对于进行稳健且有力的定量分析十分重要。尽管先前的研究表明钩状幂律分布和离散对数正态分布比幂律分布和负二项分布拟合得更好,但迄今为止尚无比较涵盖某一学科内的所有文章,包括那些未被引用的文章。基于对七个不同年份中 26 个不同 Scopus 学科领域的分析,本文报道了离散对数正态分布与钩状幂律分布对引文数据的比较,其中引文计数加 1 以包含零值。对于至少三年的期刊文章,在所测试的学科/年份组合中,有三分之二钩状幂律分布拟合更好,包括大多数医学、生命和自然科学,而对于较新的文章则几乎在所有学科领域都是如此。相反,离散对数正态分布往往最适合艺术、人文、社会科学和工程领域。然而,这些分布拟合之间的差异大多很小,因此任一分布都可合理地用于引文数据建模。但对于回归分析,最佳选择是对引文计数加一后的自然对数应用普通最小二乘回归,尤其是对于较新文章的集合,因为这样参数精度更高。
引用
@article{arxiv.1601.00473,
title = {The discretised lognormal and hooked power law distributions for complete citation data: Best options for modelling and regression},
author = {Mike Thelwall},
journal= {arXiv preprint arXiv:1601.00473},
year = {2016}
}
备注
Thelwall, M. (in press). The discretised lognormal and hooked power law distributions for complete citation data: Best options for modelling and regression. Journal of Informetrics