大语言模型能否取代人类标注?——基于无人机配送的细粒度中文地址实体识别数据集案例研究
计算与语言
2024-03-20 v2 人工智能
信息检索
摘要
我们提出 CNER-UAV,一个面向无人机配送系统中地址解析任务的细粒度中文姓名实体识别数据集。数据集涵盖五个类别,实现对 NER 模型的全面训练和评估。为构建此数据集,我们从真实的无人机配送系统中获取数据,并进行严格的数据清洗和脱敏处理,以确保隐私和数据完整性。最终得到的数据集包含约 12,000 条已标注样本,同时采用人类专家和大型语言模型 (LLM) 进行标注。我们对在数据集上进行的经典 NER 模型进行评估并提供深入分析。数据集和模型已公开于 \url{https://github.com/zhhvvv/CNER-UAV}。
引用
@article{arxiv.2403.06097,
title = {Can LLM Substitute Human Labeling? A Case Study of Fine-grained Chinese Address Entity Recognition Dataset for UAV Delivery},
author = {Yuxuan Yao and Sichun Luo and Haohan Zhao and Guanzhi Deng and Linqi Song},
journal= {arXiv preprint arXiv:2403.06097},
year = {2024}
}
备注
Accepted by TheWebConf'24 (WWW'24) as a Resource Paper