中文

从网页中全自动提取形态特征:乌托邦还是现实?

计算与语言 2025-02-24 v2 人工智能 机器学习

摘要

植物形态特征——可观察的特征——是理解每种物种在生态系统中作用的基本要素。然而,对于即使是适度数量的物种,收集特征信息可能耗时数年。同时,大量关于物种描述的信息可在线以文本形式获取,尽管缺乏结构性,使其无法按规模使用。为此,我们利用最新进展的大语言模型(LLM),构建一种无需人工审查的机制,收集和处理以非结构化文本形式描述的植物特征。我们通过自动复制三个手动创建的物种-特征矩阵来评估该方法。该方法成功为超过半数的所有物种-特征对找到数值,F1 分数超过 75%。我们的结果表明,尽管受限于覆盖所有感兴趣特征的文本描述 availability,但大规模从非结构化在线文本创建结构化特征数据库目前是可行的,这得益于 LLM 的信息抽取能力。

关键词

引用

@article{arxiv.2409.17179,
  title  = {Fully automatic extraction of morphological traits from the Web: utopia or reality?},
  author = {Diego Marcos and Robert van de Vlasakker and Ioannis N. Athanasiadis and Pierre Bonnet and Hervé Goeau and Alexis Joly and W. Daniel Kissling and César Leblanc and André S. J. van Proosdij and Konstantinos P. Panousis},
  journal= {arXiv preprint arXiv:2409.17179},
  year   = {2025}
}