中文

评估大型语言模型在濒危物种信息方面的能力

计算与语言 2025-10-06 v1 人工智能

摘要

大型语言模型(LLM)正快速被采纳用于应对生物多样性危机,但其针对物种评估的可靠性尚存疑虑。本研究系统性地验证了五个领先模型在21,955个物种上的表现,涵盖四项核心IUCN红色名录评估要素:分类学、保护状态、分布情况及威胁因素。发现了一个关键悖论:模型在分类学分类中表现出色(94.9%),但在保护推理方面持续失败(仅27.2%)。这种知识-推理差距在所有模型中均显现,表明其本质性架构限制,而非仅数据限制。此外,模型呈现系统性偏好,倾向于热门脊椎动物,可能放大现有保护不平等。我们的发现界定了负责任 LLM 应用的明确边界:它们是信息检索的强大工具,但需人工监督才能做出基于判断的决策。我们建议采用混合方法,即 LLM 增强专家能力,同时人工专家保留风险评估与政策制定的唯一权威。

关键词

引用

@article{arxiv.2510.02830,
  title  = {Evaluating Large Language Models for IUCN Red List Species Information},
  author = {Shinya Uryu},
  journal= {arXiv preprint arXiv:2510.02830},
  year   = {2025}
}

备注

20 pages, 7 figures