基于Transformer大语言模型的零样本数据引用功能分类
机器学习
2025-11-06 v1 人工智能
计算与语言
摘要
近年来,识别特定数据集与引用它们的科学文献之间关联的努力日益增加。在已知某篇出版物引用某个数据集后,合乎逻辑的下一步是探究该数据是如何或为何被使用的。近年来,基于预训练Transformer的大语言模型(LLM)的进展为规模化描述已发表文献中的数据用例提供了潜在手段。这避免了昂贵的人工标注和为传统机器学习(ML)系统开发训练数据集。在这项工作中,我们应用开源LLM Llama 3.1-405B,为已知使用了特定基因组数据集的出版物生成结构化的数据用例标签。我们还引入了一个新颖的评估框架,用于确定我们方法的有效性。我们的结果表明,在没有任何预定义类别的零样本数据引用分类任务上,该基础模型能够达到0.674的F1分数。尽管前景可期,但我们的结果受到数据可用性、提示过拟合、计算基础设施以及进行负责任的性能评估所需成本等障碍的限制。
引用
@article{arxiv.2511.02936,
title = {Zero-shot data citation function classification using transformer-based large language models (LLMs)},
author = {Neil Byers and Ali Zaidi and Valerie Skye and Chris Beecroft and Kjiersten Fagnan},
journal= {arXiv preprint arXiv:2511.02936},
year = {2025}
}