中文

利用视觉 Transformer 量化字符相似性

计算与语言 2023-05-25 v1 计算机视觉与模式识别 综合经济学 经济学

摘要

记录链接是定量社会科学的基石,因为分析常需将来自多个含噪源的数据进行链接。现成的字符串匹配方法被广泛使用,因其直接、实现与扩展成本低。并非所有字符替换都等概率,且对某些场景存在广泛使用的手工列表指明哪些字符串替换更可能,可提升字符串匹配准确率。然而,许多场景下并无此类列表,使得基于链接数据集的研究偏向少数高资源语境,无法代表人类社会的多样性。本研究通过利用增强数字字体对视觉 Transformer (ViT) 进行大规模自监督训练,开发了一种可扩展的 OCR 文档字符替换代价度量方法。对每种以 CJK 文字书写的语言,我们对比式地学习一个度量空间,其中同一字符的不同增强在空间中彼此邻近。在该空间中,同形字符——即外观相似如 ``O'' 与 ``0'' 者——具有相近的向量表示。在编辑距离匹配算法中,使用字符表示间的余弦距离作为替换代价,相较其他广泛使用的字符串匹配方法显著改善了记录链接,因为 OCR 错误往往本质为同形。同形字符可合理捕捉任意文字(包括低资源场景)的字符视觉相似性。我们为此创建了 3000 年前古汉字的同形集予以说明,其高度象形。有趣的是,ViT 能够捕捉古代社会对不同抽象概念的概念化关系,而这已在考古文献中被指出。

关键词

引用

@article{arxiv.2305.14672,
  title  = {Quantifying Character Similarity with Vision Transformers},
  author = {Xinmei Yang and Abhishek Arora and Shao-Yu Jheng and Melissa Dell},
  journal= {arXiv preprint arXiv:2305.14672},
  year   = {2023}
}