中文

去殖民化数据系统:将Jyutping或Pinyin作为中文姓名的声调表示用于数据链接

计算与语言 2026-01-13 v1

摘要

数据链接正在为健康研究和政策制定所广泛应用,对于理解健康不平等问题至关重要。然而,链接后的数据仅限于其底层数据质量,差异化的链接率可能在链接后数据中引发选择偏差。一种可能削弱数据质量的机制是姓名罗马化。将不同书写系统的文本转换为基于拉丁字母的书写(即罗马化),长期以来一直是表示以表意文字为主的语言(如中文、越南语以及其他语言如斯瓦希利语)中姓名的标准过程。由于缺乏对正确姓名顺序的考虑以及对声调语言缺乏proper的音标表示,中文姓名的非标准化罗马化导致了对中文移民的较差链接率。本意见稿旨在建议使用为粤语(Jyutping)或普通话(Pinyin)设计的标准化罗马化系统,这些系统包含声调信息,从而提高具有中文姓名者的链接率和准确性。我们从公开来源爬取了771个中文和英文姓名,比较了Jyutping、Pinyin和香港政府罗马化系统(HKG-romanisation)用于表示中文姓名的效用。我们证明了Jyutping和Pinyin相较于香港政府罗马化系统所产生的错误更少。我们建议,收集和保存人民的原始书写系统中的姓名在伦理和社会层面都具有重要性。这可能有助于开发针对不同语言的预处理和链接范式,从而实现更具包容性的研究数据,更好地代表受众群体。

关键词

引用

@article{arxiv.2409.13706,
  title  = {Decolonising Data Systems: Using Jyutping or Pinyin as tonal representations of Chinese names for data linkage},
  author = {Joseph Lam and Mario Cortina-Borja and Robert Aldridge and Ruth Blackburn and Katie Harron},
  journal= {arXiv preprint arXiv:2409.13706},
  year   = {2026}
}