中文

利用大语言模型进行政治科学中的模糊字符串匹配

人工智能 2024-03-28 v1

摘要

当政治科学家合并来自不同来源的数据时,模糊字符串匹配仍然是一个关键问题。现有的匹配方法无一例外地依赖于字符串距离,例如莱文斯坦距离和余弦相似度。因此,它们本质上无法匹配那些指代同一实体但名称不同的字符串,例如“JP Morgan”和“Chase Bank”、“DPRK”和“North Korea”、“Chuck Fleischmann (R)”和“Charles Fleischmann (R)”。在本信中,我们提出使用大语言模型以简单直观的方式完全绕过这一问题。大量实验表明,我们提出的方法在平均精度方面可将现有技术水平提高多达39%,同时政治科学家使用起来更加简单直观。此外,我们的结果对各种温度参数具有鲁棒性。我们进一步指出,增强提示可以带来额外的性能提升。

关键词

引用

@article{arxiv.2403.18218,
  title  = {Leveraging Large Language Models for Fuzzy String Matching in Political Science},
  author = {Yu Wang},
  journal= {arXiv preprint arXiv:2403.18218},
  year   = {2024}
}

备注

7 pages, 2 figures, 1 table;