VILLA:使用大型语言模型从科学文献中进行通用信息检索
信息检索
2026-03-26 v1
摘要
缺乏高质量真实数据集以训练机器学习 (ML) 模型,阻碍了人工智能 (AI) 为科学研究所潜在的应用。使用 LLM 从文献中提取科学信息是一种强大的自动化创建这些数据集的方法。然而,现有的 LLM-based 方法和基准研究聚焦于生物医学和化学等广泛领域,仅限于选择式任务,侧重于从短小且格式良好的文本中提取信息。VILLA 方法在复杂、开放性任务中发挥 SIE 方法潜力的潜力显著受到忽视。在本研究中,我们聚焦于在 SIE 中几乎被忽视的领域——病毒学,以此解决上述研究空白。我们设计了一个独特的、开放式的 SIE 任务,即从给定病毒中提取修改其与宿主相互作用的突变。我们开发了一个新的、多步骤检索增强生成 (RAG) 框架,称为 VILLA 用于 SIE。同时,我们策划了一个新的由 629 个十类流感 A 病毒蛋白突变组成的 数据集,来自 239 篇科学出版物,作为突变提取任务的真实数据。最后,我们演示了 VILLA 相较于 vanilla RAG 和其他最新 SIE 的 RAG 和代理工具在性能上的卓越表现。
引用
@article{arxiv.2603.23849,
title = {VILLA: Versatile Information Retrieval From Scientific Literature Using Large LAnguage Models},
author = {Blessy Antony and Amartya Dutta and Sneha Aggarwal and Vasu Gatne and Ozan Gökdemir and Samantha Grimes and Adam Lauring and Brian R. Wasik and Anuj Karpatne and T. M. Murali},
journal= {arXiv preprint arXiv:2603.23849},
year = {2026}
}
备注
Under review at ACM KDD 2026 (AI for Sciences Track)