中文

基于内容与算法的期刊分类:科学传播动力学与标引效应的视角

数据分析、统计与概率 2009-01-09 v1 数字图书馆 信息检索 物理与社会

摘要

基于科学引文索引的期刊引证报告(JCR)的聚合期刊-期刊引证矩阵,可以通过标引者和/或算法进行分解。在本研究中,我们针对两种新近可用的大矩阵分解算法的结果,与两种基于内容的期刊分类进行了比对:ISI学科分类和Glaenzel与Schubert(2003)的领域/子领域分类。基于内容的分类方案允许为一个期刊赋予多个类别,而算法则在聚合的类别-类别引证矩阵中最大化类别内引证与类别间引证的比率。通过增加类别,标引者生成了类别间引证,这可能会丰富数据库,例如在跨学科发展的情况下。由此产生的标引效应在矩阵的稀疏区域比在稠密区域更为显著。另一方面,算法分解更严重地偏向于相对较少数量的类别,而在基于内容的分类中则有意抵消了这一点。由于标引效应,科学政策研究和科学社会学在使用基于内容的分类时应谨慎,因为这些分类是为书目检索而制定的,而非用于分析科学传播中的潜在结构。尽管这四种分类方案之间存在巨大差异,但它们使我们能够在全局层面生成惊人相似的科学图谱。错误的分类在聚合层面作为噪声被抵消,但可能会干扰局部评估。

关键词

引用

@article{arxiv.0812.4332,
  title  = {Content-based and Algorithmic Classifications of Journals: Perspectives on the Dynamics of Scientific Communication and Indexer Effects},
  author = {Ismael Rafols and Loet Leydesdorff},
  journal= {arXiv preprint arXiv:0812.4332},
  year   = {2009}
}