中文

Doc2SAR:从科学文献中提取结构-活性关系的高保真协同框架

计算与语言 2025-10-14 v2 人工智能 信息检索

摘要

从科学文献和专利中提取分子结构-活性关系 (SAR) 是药物发现和材料研究中的关键任务。然而,该任务因文档格式异构且现有方法局限性而仍具挑战。具体而言,依赖刚性模板的规则化方法难以在多样化文档布局上泛化,而通用多模态大语言模型 (MLLM) 则缺乏针对专业任务(如布局检测和光学化学结构识别 OCSR)的足够精度和可靠性。为此,我们构建了 DocSAR-200,即包含 200 份科学文档的严格标注基准数据集,专为评估 SAR 提取方法而设计。此外,我们提出 Doc2SAR,一种新型协同框架,集成领域特定工具与经过监督微调 (SFT) 的 MLLM。广泛实验表明,Doc2SAR 在各种文档类型上实现了最先进的性能,显著优于领先的端到端基线方法。在 DocSAR-200 上的整体表格召回率达 80.78%,超越端到端的 GPT-4o 高出 51.48%。此外,Doc2SAR 还展示了通过高效推理实现的实际可用性,并附带一个 Web 应用。

关键词

引用

@article{arxiv.2506.21625,
  title  = {Doc2SAR: A Synergistic Framework for High-Fidelity Extraction of Structure-Activity Relationships from Scientific Documents},
  author = {Jiaxi Zhuang and Kangning Li and Jue Hou and Mingjun Xu and Zhifeng Gao and Hengxing Cai},
  journal= {arXiv preprint arXiv:2506.21625},
  year   = {2025}
}