中文

基于文献检索生成聚合物知识的体系化方法:可降解聚合物专家系统案例

计算工程、金融与科学 2026-02-19 v1 人工智能

摘要

聚合物文献包含大量且不断增长的实验知识,但这些知识大部分被埋没在非结构化文本中且术语不一致,使得系统检索和推理困难。现有工具通常以孤立的、特定研究的事实进行提取,无法保留跨研究的背景,以回答更广泛的科学问题。检索增强生成(Retrieval-Augmented Generation, RAG)提供了一种通过结合大语言模型(LLM)和外部检索来克服这一限制的 promising 方法,但其效果高度依赖于领域知识的表示方式。在本工作中,我们开发了两种检索管道:基于稠密语义向量的方法(VectorRAG)和基于图的方法(GraphRAG)。使用超过 1,000 篇聚氨酸酰胺(PHA)论文,我们构建了保持上下文的段落嵌入和一个标准化的结构化知识图谱,支持实体消歧和多跳推理。我们通过标准检索指标、与通用最先进系统如 GPT 和 Gemini 的比较,以及领域化学师的定性验证来评估这些管道。结果表明,GraphRAG 在精度和可解释性方面取得了更好的表现,而 VectorRAG 提供了更广泛的召回率,突显了互补的权衡。专家验证进一步确认,针对性的管道,特别是 GraphRAG,能够产生基于证据的、带有可靠引用且高度相关的响应。通过将每个声明都 grounding在证据之上,这些系统使研究人员能够浏览文献、跨研究比较发现,并发现难以手动提取的模式。更广泛地说,这项工作为使用精选语料库和检索设计构建材料科学助手提供了实用框架,减少了对专有模型的依赖,使规模化的可信文献分析成为可能。

关键词

引用

@article{arxiv.2602.16650,
  title  = {Retrieval Augmented Generation of Literature-derived Polymer Knowledge: The Example of a Biodegradable Polymer Expert System},
  author = {Sonakshi Gupta and Akhlak Mahmood and Wei Xiong and Rampi Ramprasad},
  journal= {arXiv preprint arXiv:2602.16650},
  year   = {2026}
}