基于大型语言模型的高层次腐败方案实体抽取
计算与语言
2024-11-12 v2 信息检索
摘要
近年来观察到的金融犯罪增多,使该领域日益引人关注。许多人、组织和政府正在不断增加应对这一问题的努力。尽管兴趣日益增长,但缺乏可用于训练和评估这类问题解决方法的数据集。本文提出一种新的微型基准数据集,用于识别新闻文章中涉及个人和组织以及其多重表述的算法和模型。我们还提出了一种辅助数据集创建的方法。报告了实验成果,这些成果利用该数据集,通过多种低十亿参数的大型语言模型(LLM)识别金融犯罪相关文章中的个人和组织。对于这些实验,我们报告了标准指标(准确率、精确率、召回率、F1分数),并测试了各种包含提示工程最佳实践的提示变体。此外,为解决实体提及模糊问题,提出了一种简单而有效的LLM-based消歧方法,以确保评估符合现实情况。最后,我们将所提方法与广泛使用的开源基线方法进行比较,显示所提方法的优越性。
引用
@article{arxiv.2409.13704,
title = {Entity Extraction from High-Level Corruption Schemes via Large Language Models},
author = {Panagiotis Koletsis and Panagiotis-Konstantinos Gemos and Christos Chronis and Iraklis Varlamis and Vasilis Efthymiou and Georgios Th. Papadopoulos},
journal= {arXiv preprint arXiv:2409.13704},
year = {2024}
}