中文

面向医学情境中知识合成的AI合作科学家:概念验证

人工智能 2026-01-21 v1 信息检索

摘要

生物医学领域的研究浪费源于重复研究、不完整报告以及传统证据综合工作流程的有限可扩展性。我们提出了一种基于人群、干预、对照、结局和研究设计(PICOS)显式形式化的、可扩展且透明的知识合成AI合作科学家。该平台集成了关系型存储、基于向量的语义检索和Neo4j知识图谱。在痴呆症-运动和非传染性疾病语料库上进行了评估。使用双向长短期记忆网络基线和一个基于PubMedBERT微调的Transformer多任务分类器,从标题和摘要中自动进行PICOS合规性和研究设计分类。全文合成采用检索增强生成,结合了混合向量与图谱检索,同时使用BERTopic识别主题结构、冗余和证据空白。Transformer模型在研究设计分类上达到了95.7%的准确率,与专家标注高度一致,而Bi-LSTM在PICOS合规性检测上达到了87%的准确率。对于需要结构化约束、跨研究整合和基于图谱推理的查询,检索增强生成优于无检索生成,而无检索方法在生成高层摘要方面仍具竞争力。主题建模揭示了显著的主题冗余,并识别出研究不足的领域。这些结果表明,具备PICOS感知和可解释性的自然语言处理能够提高证据综合的可扩展性、透明度和效率。所提出的架构与领域无关,为减少生物医学各学科的研究浪费提供了一个实用框架。

关键词

引用

@article{arxiv.2601.11825,
  title  = {AI Co-Scientist for Knowledge Synthesis in Medical Contexts: A Proof of Concept},
  author = {Arya Rahgozar and Pouria Mortezaagha},
  journal= {arXiv preprint arXiv:2601.11825},
  year   = {2026}
}