中文

基于提示优化的大语言模型自动标注方法在生物分类学命名法中的评估

计算与语言 2026-01-13 v2 人工智能

摘要

生物学名称由属名和种 epithet 组成,后者常反映形态、生态、分布和文化背景等方面。传统上,研究人员通过仔细检查分类描述来手动标注种名称,这在处理大型数据集时需要大量时间和精力。本研究评估了利用大语言模型 (LLM) 的自动化种名称标注的可行性,借助其文本分类和语义提取能力。我们使用 Mammola 等人编制的蜘蛛名称数据集,比较了通过提示工程增强的 LLM 标注结果与人工标注。结果表明,LLM 在形态、地理和人物类别中实现了高准确率。然而,在生态与行为和现代与过去文化类别中,分类准确率较低,揭示了在解释动物行为和文化背景方面的挑战。未来研究将致力于通过优化的少样本学习和检索增强生成技术提高准确率,同时将 LLM 标注的适用性扩展到多样化的生物分类学。

关键词

引用

@article{arxiv.2503.10662,
  title  = {Evaluation of the Automated Labeling Method for Taxonomic Nomenclature Through Prompt-Optimized Large Language Model},
  author = {Keito Inoshita and Kota Nojiri and Haruto Sugeno and Takumi Taga},
  journal= {arXiv preprint arXiv:2503.10662},
  year   = {2026}
}

备注

This paper was accepted by IEEE IAICT