BioUNER:临床乌尔都语命名实体识别基准数据集
计算机视觉与模式识别
2026-04-06 v1
摘要
本文提出了一种用于生物医学乌尔都语命名实体识别(BioUNER)的金标准基准数据集,通过从在线乌尔都语新闻门户、医学处方和医院健康博客及网站爬取健康相关文章构建而成。预处理后,三位熟悉医学领域的本地标注者使用 Doccano 文本标注工具参与了标注过程,标注了 153K 个 token。标注完成后,所提出的 BioUNER 数据集经过内在和外在评估。达到了 0.78 的人工标注者一致性得分,从而验证了数据集的金标准质量。为展示数据集的实用性和基准能力,我们评估了多种机器学习和深度学习模型,包括支持向量机(SVM)、长短期记忆网络(LSTM)、多语言 BERT(mBERT)和 XLM-RoBERTa。金标准 BioUNER 数据集作为可靠的基准和乌尔都语语言处理资源的宝贵补充。
引用
@article{arxiv.2604.02905,
title = {UniSpector: Towards Universal Open-set Defect Recognition via Spectral-Contrastive Visual Prompting},
author = {Geonuk Kim and Minhoi Kim and Kangil Lee and Minsu Kim and Hyeonseong Jeon and Jeonghoon Han and Hyoungjoon Lim and Junho Yim},
journal= {arXiv preprint arXiv:2604.02905},
year = {2026}
}
备注
Accepted to CVPR 2026