中文

BioMol-MQA:用于大语言模型对生物分子相互作用进行推理的多模态问答数据集

计算与语言 2025-06-09 v1

摘要

检索增强生成(RAG)在提高大型语言模型(LLM)性能方面显示出巨大的潜力。然而,现有大多数基于RAG的LLM仅专注于单一模态信息,主要是文本;而对于许多现实世界的问题(如医疗保健),与查询相关的知识可以以多种模态呈现,包括知识图谱、文本(临床记录)以及复杂的分子结构。因此,能够检索相关的多模态领域特定信息,并对多样化的知识进行推理与综合,以生成准确响应,显得尤为重要。为此,我们提出BioMol-MQA,一组针对多处方(polypharmacy)问题的问答数据集,包含两个部分:(i)包含文本和分子结构的多模态知识图谱(KG),用于信息检索;(ii)旨在测试LLM在检索和推理多模态KG以回答问题方面能力的具挑战性问题。我们的基准测试表明,现有的LLM在回答这些问题方面困难重重,只有在提供必要背景数据后才能取得良好表现,这凸显了强大RAG框架的必要性。

关键词

引用

@article{arxiv.2506.05766,
  title  = {BioMol-MQA: A Multi-Modal Question Answering Dataset For LLM Reasoning Over Bio-Molecular Interactions},
  author = {Saptarshi Sengupta and Shuhua Yang and Paul Kwong Yu and Fali Wang and Suhang Wang},
  journal= {arXiv preprint arXiv:2506.05766},
  year   = {2025}
}