中文

基于大语言模型中的原语学习与提示链自动化科学文本分类

信息检索 2026-04-28 v1 人工智能 计算与语言 数字图书馆 软件工程

摘要

科学文献的不断扩张为导航和知识发现带来了重大挑战。在研究信息检索领域,文本摘要和分类等既定任务仍是关键,旨在帮助研究人员和实践者有效地导航这片广阔的知识版图,因此越来越多的工作致力于开发先进的研究信息系统。这些系统旨在不仅提供标准的基于关键词的搜索功能,还能够在学术界和行业的知识密集型组织中集成自动内容分类能力。本研究系统性地评估了即插即用的大型语言模型(LLMs)在给定分类方案下的科学文本分析性能。我们采用 ORKG 分类框架作为分类框架,利用 FORC 数据集作为基准。我们检验了先进的提示工程策略,即原语学习(ICL)和提示链(Prompt Chaining)的有效性,并实验探讨了大型语言模型温度超参数对分类准确率的影响。我们的实验表明,提示链在纯 ICL 之上提供更好的分类准确率,尤其是针对 ORKG 分类框架的嵌套结构。带提示链的大型语言模型在域(第一级)预测方面超过了最先进的模型,在主题(第二级)预测方面甚至优于较旧的 BERT 模型。然而,大型语言模型尚未能够在此特定的分层分类框架下对研究领域的主题(第三级)进行良好分类,即使采用提示链也仅达到约 50% 的准确率。

关键词

引用

@article{arxiv.2604.23430,
  title  = {Automating Categorization of Scientific Texts with In-Context Learning and Prompt-Chaining in Large Language Models},
  author = {Gautam Kishore Shahi and Oliver Hummel},
  journal= {arXiv preprint arXiv:2604.23430},
  year   = {2026}
}

备注

25 pages