超越传统算法:利用LLM实现跨境实体识别
计算与语言
2025-07-16 v1
摘要
跨境金融活动在全球市场中日益普及,凸显了准确识别和分类外国实体的必要性。这一做法对于西班牙金融体系中的健全风险管理、监管遵从以及防止金螺纱行为至关重要。这一过程涉及需要与可用参考来源进行实体匹配的耗散性实体识别任务。由于语言差异、特殊字符、过时名称以及法律形式的变化,传统匹配算法(如Jaccard、余弦和Levenshtein距离)面临挑战,这些方法在处理语境细微差异和语义关系方面困难,导致匹配不准确。为克服这些限制,我们探索使用大型语言模型(LLM)作为灵活替代方案。LLM利用广泛的训练数据来解释语境、处理缩写并适应法律变更。我们使用包含65个葡萄牙公司案例的数据集评估了传统方法、基于Hugging Face的LLM以及基于接口的LLM(如Microsoft Copilot、阿里巴巴的Qwen 2.5)。结果显示,传统方法准确率超过92%,但存在较高的误报率(20-40%)。基于接口的LLM表现更好,准确率超过93%,F1分数超过96%,误报率降低(40-80%)。
引用
@article{arxiv.2507.11086,
title = {Beyond Traditional Algorithms: Leveraging LLMs for Accurate Cross-Border Entity Identification},
author = {Andres Azqueta-Gavaldón and Joaquin Ramos Cosgrove},
journal= {arXiv preprint arXiv:2507.11086},
year = {2025}
}