结构化XML科学文章中荷代谢参数的自动提取:提升大规模数据可达性
信息检索
2026-04-24 v1
摘要
在药理学领域,缺乏集中、全面且最新的荷代谢(PK)数据存储库。这构成了R&D的重大挑战,因为从多样化的科学出版物中收集所需的定量PK参数可能是一项耗时且具有挑战性的任务。这种定量PK信息主要以表格形式组织,主要以XML、HTML或PDF文件形式存在于各种在线存储库和科学出版物中,包括补充材料。这使得表格成为科学或监管文件中至关重要的组成部分和信息元素,因为它们通常被用于呈现定量信息。从表格中提取数据通常是一项耗费人力的工作,替代性的自动机器学习模型可能难以准确检测和提取相关数据 due to 表格复杂性和多样化布局。信息提取和阅读顺序检测的困难在很大程度上取决于表格的结构复杂性。对表格的理解应优先捕获表格单元格内容的方式,这种方式与人类读者自然理解信息的方式相吻合。FARAD已多年来手动从文献和监管机构中提取表格数据和其他信息。然而,由于每日发布的出版物数量庞大,现已迫切需要自动化此过程。由于当前面临的人员短缺,此任务的准确性变得越来越具有挑战性,这 necessitates 开发能够精确处理按表格结构(由列和/或行标题信息指示)组织的单元格的AI算法。
引用
@article{arxiv.2604.21063,
title = {Automated Extraction of Pharmacokinetic Parameters from Structured XML Scientific Articles: Enhancing Data Accessibility at Scale},
author = {Remya Ampadi Ramachandran and Lisa A. Tell and Sidharth Rai and Nuwan Millagaha Gedara and Hossein Sholehrasa and Jim E. Riviere and Majid Jaberi-Douraki},
journal= {arXiv preprint arXiv:2604.21063},
year = {2026}
}
备注
43 pages, 3 tables, 5 figures, includes Supplementary Materials