库尔德语索兰�语言命名实体识别:数据集创建与比较分析
机器学习
2025-12-01 v1 计算工程、金融与科学
社会与信息网络
综合经济学
经济学
摘要
本工作通过提出首个针对库尔德语索兰�语言的命名实体识别数据集,旨在增强自然语言处理技术的包容性和全球适用性。该数据集包含 64,563 个已标注词语。同时提供了一个用于支持此任务及其他语言的工具,并进行了彻底的比较分析,包括经典机器学习模型和神经网络系统。得到的结果挑战了关于神经方法在 NLP 语境下优势的既定假设。尤其是,CRF 方法获得的 F1 分数为 0.825,显著优于基于 BiLSTM 的模型(0.706)。这些发现表明,在低资源环境中,更简单且计算更高效的经典框架可以超越神经网络架构。
引用
@article{arxiv.2511.22314,
title = {DeXposure: A Dataset and Benchmarks for Inter-protocol Credit Exposure in Decentralized Financial Networks},
author = {Wenbin Wu and Kejiang Qian and Alexis Lui and Christopher Jack and Yue Wu and Peter McBurney and Fengxiang He and Bryan Zhang},
journal= {arXiv preprint arXiv:2511.22314},
year = {2025}
}
备注
Data and code: https://github.com/dthinkr/DeXposure - Visualisation: https://ccaf.io/defi/ecosystem-map/visualisation/graph