中文

大语言模型赋能的半结构化网络文章高通量生物医学关系抽取

计算与语言 2024-03-27 v4 人工智能

摘要

目的:开发一种高通量生物医学关系抽取系统,以可扩展且可举证的方式利用大语言模型(LLMs)的阅读理解能力和生物医学世界知识。方法:我们将关系抽取任务构建为针对大语言模型的二分类问题。具体而言,LLMs 基于外部语料库及其世界知识做出决策,并为事实核查提供判断理由。该方法专为半结构化网络文章定制,其中我们将主标题指定为尾实体并显式将其纳入上下文,同时基于生物医学叙词表匹配潜在的头实体。此外,长篇内容被切片为文本块,经嵌入后通过额外的嵌入模型进行检索。结果:利用开源 LLM,我们从三个权威生物医学网站中提取了 248,659 个属于三种不同关系类型的关系三元组。为评估用于生物医学关系抽取的基础流程的效能,我们策划了一个由医学专家标注的基准数据集。评估结果表明,该流程表现出与 GPT-4 相当的性能。案例研究进一步阐明了当代 LLMs 在半结构化网络文章生物医学关系抽取背景下所面临的挑战。结论:所提出的方法已证明其在利用 LLMs 优势进行高通量生物医学关系抽取方面的有效性。其适应性显而易见,因为它可以无缝扩展至各种半结构化生物医学网站,从而轻松促进各类生物医学关系的抽取。

关键词

引用

@article{arxiv.2312.08274,
  title  = {High-throughput Biomedical Relation Extraction for Semi-Structured Web Articles Empowered by Large Language Models},
  author = {Songchi Zhou and Sheng Yu},
  journal= {arXiv preprint arXiv:2312.08274},
  year   = {2024}
}