探索大型语言模型用于将生物分类学数据转换为 OWL:经验教训与对本体开发的影响
人工智能
2025-05-27 v1
摘要
在代表物种分类学的本体中管理科学名称具有挑战性,因为这些分类学不断演变。当处理数千个科学名称时,手动维护变得日益困难。为此,本文考察了使用 ChatGPT-4 自动开发作物产品类型本体 (APTO) 中用于物种分类的 :Organism 模块。我们的 methodology 包括利用 ChatGPT-4 从 GBIF Backbone API 提取数据并生成用于后续集成到 APTO 的 OWL 文件。探索了两种替代方法:(1) 通过 BrowserOP 插件执行一系列提示以完成任务;(2) 指导 ChatGPT-4 设计一种执行类似任务的 Python 算法。这两种方法都依赖于一种提示方法,即提供指令、上下文、输入数据和输出指示。第一种方法存在可扩展性限制,而第二种方法则使用 Python 算法克服了这些挑战,但在数据处理过程中遇到拼写错误。本研究突显了大型语言模型如 ChatGPT-4 在简化本体中物种名称管理方面的潜力。尽管存在某些局限性,但这些工具为自动化处理与分类学相关的任务并提高本体开发效率提供了有前景的进展。
引用
@article{arxiv.2504.18651,
title = {Exploring a Large Language Model for Transforming Taxonomic Data into OWL: Lessons Learned and Implications for Ontology Development},
author = {Filipi Miranda Soares and Antonio Mauro Saraiva and Luís Ferreira Pires and Luiz Olavo Bonino da Silva Santos and Dilvan de Abreu Moreira and Fernando Elias Corrêa and Kelly Rosa Braghetto and Debora Pignatari Drucker and Alexandre Cláudio Botazzo Delbem},
journal= {arXiv preprint arXiv:2504.18651},
year = {2025}
}
备注
31 pages, 6 Figures, accepted for publication in Data Intelligence