天文命名实体识别(Astro-NER):GPT 是否是良好的领域专家标注员?
计算与语言
2024-05-07 v1 人工智能
信息论
math.IT
摘要
在本研究中,我们解决了开发学术领域NER模型的一个挑战,即缺乏合适的标注数据。我们实验了一种使用微调的大语言模型模型预测来帮助非领域专家标注天文文献中的科学实体的方法,目标是探讨这种协作过程是否可以逼近领域专家的水平。我们的结果显示,领域专家与LLM辅助的非专家之间存在适度的一致性,而领域专家与LLM模型预测之间只有较差的一致性。在一次额外的实验中,我们比较了微调和默认LLM在该任务上的性能。我们还引入了一个针对天文学的专业科学实体标注方案,已由领域专家验证。我们的ethods采用以学术研究贡献为中心的视角,专注于与研究主题相关的科学实体。最终生成的数据集包含5000条标注好的天文文章标题,并已公开发布。
引用
@article{arxiv.2405.02602,
title = {Astro-NER -- Astronomy Named Entity Recognition: Is GPT a Good Domain Expert Annotator?},
author = {Julia Evans and Sameer Sadruddin and Jennifer D'Souza},
journal= {arXiv preprint arXiv:2405.02602},
year = {2024}
}
备注
9 pages