基于前沿LLM代理的自然表型本体策辊突破
人工智能
2026-05-29 v1
摘要
将自由文本表型描述与本体术语关联,通常称为表型注释,是实现比较形态数据跨研究集成的关键。该过程高度依赖高度训练的人类专家,使其难以规模化,成为关键瓶颈。Dahdul等人(2018)建立了跨七个生物学 phylogenetic 研究的实体-质量(Entity-Quality, EQ)注释的黄金标准(Gold Standard, GS),并用于评估三名人类策辊和Semantic CharaParser NLP工具,采用基于本体的语义相似性指标;他们报告称机器-人类一致性显著低于策辊间(人类-人类)一致性。本文以五个来自Anthropic和OpenAI的前沿托管LLM为基准,每个LLM作为“代理策辊”在自包含工作区中运行,提供源出版物PDF、原始人类策辊使用的同一注释指南、四个项目本体(UBERON、PATO、BSPO、GO),以及验证脚本。针对相同的黄金标准进行评估,每个代理的表现都落于原研究中三名训练有素的生物策辊的人类策辊表现范围内;表现最佳的代理接近但未达到最佳人类策辊的表现。代理在所有四个指标上均显著优于Semantic CharaParser。
引用
@article{arxiv.2605.28965,
title = {Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes},
author = {James P. Balhoff and Hilmar Lapp},
journal= {arXiv preprint arXiv:2605.28965},
year = {2026}
}
备注
7 pages, 2 figures