中文

Hybrid-SQuAD:混合学术问答数据集

计算与语言 2024-12-06 v2 人工智能

摘要

现有的学术问答(QA)方法通常针对单一数据源进行设计,仅依赖文本或知识图谱(KG)中的信息。然而,学术信息常常跨越异构数据源,迫切需要开发能够整合来自多个异构数据源的信息的 QA 系统。为此,我们引入了 Hybrid-SQuAD(Hybrid Scholarly Question Answering Dataset),这是一个新型大规模 QA 数据集,旨在促进包含文本和 KG 事实的问答。该数据集由 10.5K 条问答对组成,由大语言模型生成,利用 KG DBLP 和 SemOpenAlex 以及对应的 Wikipedia 文本。此外,我们提出了基于 RAG 的基线混合 QA 模型,在 Hybrid-SQuAD 测试集上实现了 69.65 的准确匹配得分。

关键词

引用

@article{arxiv.2412.02788,
  title  = {Hybrid-SQuAD: Hybrid Scholarly Question Answering Dataset},
  author = {Tilahun Abedissa Taffa and Debayan Banerjee and Yaregal Assabie and Ricardo Usbeck},
  journal= {arXiv preprint arXiv:2412.02788},
  year   = {2024}
}