中文

学术数据跨语言桥梁 I:增强面向中文姓名的作者消歧算法

数字图书馆 2026-04-07 v1 物理与社会

摘要

消歧具有相同姓名的学者对于准确的作者分配和稳健的大规模计量研究至关重要。现有方法通常为拉丁字母元数据设计,针对中文姓名表现不佳。在国际出版物中,中文姓名通常以罗马化拼音形式出现,这高度模糊,因为它可以映射到多个 distinct 字符。相比之下,中文字符虽能降低但也不消除这种模糊性,在国际记录中几乎不可用。为解决这两个挑战,我们提出一种基于规则的消歧框架,集成共同作者网络、引用网络、作者机构和内容相似性。我们将该框架应用于中国国家知识基础设施 (CNKI) 中的 65,241 篇物理论文,涵盖超过 70 年的数据。在一组 80 个人工标注的姓名对样本上,我们的方法对拼音姓名和字符姓名的 F1 分别为 0.88 和 0.89,优于两个基线方法,改进主要来自更高的召回率。两种书写系统中相当的性能显示,我们的方法是无脚本依赖的,能够实现可靠的大规模计量分析。

关键词

引用

@article{arxiv.2604.03776,
  title  = {Bridging the Language Gap in Scholarly Data I: Enhancing Author Disambiguation Algorithms for Chinese Names},
  author = {Mingrong She and Liuhuaying Yang and Ana Maria Jaramillo and Lisette Espín-Noboa},
  journal= {arXiv preprint arXiv:2604.03776},
  year   = {2026}
}