中文

NeuroSym-BioCAT:利用神经符号方法进行生物医学学术文献分类与问答

计算与语言 2024-11-04 v1 人工智能 数字图书馆 信息检索

摘要

生物医学学术文献摘要数量的不断增长,对高效检索准确且相关信息提出了日益严峻的挑战。为解决此问题,我们引入了一种新方法,将优化的主题建模框架 OVB-LDA 与 BI-POP CMA-ES 优化技术相结合,以增强学术文献摘要分类。作为补充,我们采用在领域特定数据上微调的蒸馏 MiniLM 模型,进行高精度答案抽取。我们的方法在三种配置下进行了评估:学术文献摘要检索、黄金标准学术文献摘要和黄金标准片段,其性能始终优于 RYGH 和 bio-answer finder 等现有方法。值得注意的是,我们证明了仅从学术文献摘要中提取答案即可获得高准确率,凸显了摘要对于许多生物医学查询的充分性。尽管 MiniLM 尺寸紧凑,但其表现出了有竞争力的性能,挑战了只有大型、资源密集型模型才能处理此类复杂任务的普遍观念。我们的结果经过多种问题类型和评估批次的验证,突显了该方法在实际生物医学应用中的稳健性和适应性。虽然我们的方法显示出前景,但我们识别出在处理复杂列表型问题以及评估指标不一致方面的挑战。未来的工作将侧重于利用更广泛的领域特定数据集优化主题模型,进一步优化 MiniLM,并利用大型语言模型 (LLM) 来提高生物医学问答的精度和效率。

关键词

引用

@article{arxiv.2411.00041,
  title  = {NeuroSym-BioCAT: Leveraging Neuro-Symbolic Methods for Biomedical Scholarly Document Categorization and Question Answering},
  author = {Parvez Zamil and Gollam Rabby and Md. Sadekur Rahman and Sören Auer},
  journal= {arXiv preprint arXiv:2411.00041},
  year   = {2024}
}