中文

47 种上下文依赖问答模型在 8 个多样数据集上的比较分析

计算与语言 2025-12-02 v1 人工智能

摘要

上下文依赖问答 (CBQA) 模型通过考虑上下文信息提供更准确和更相关的答案。它们有效地从给定上下文中提取特定信息,使其在涉及用户支持、信息检索和教育平台的各种应用中具有功能性。在本手稿中,我们在八个不同数据集上对 47 个来自 Hugging Face 的 CBQA 模型进行基准测试。本研究旨在在不进行额外微调的情况下识别跨数据集表现最佳的模型。这对于实际应用非常重要,因为它最小化了为特定数据集重新训练模型的需求,简化了这些模型在各种情境中的实现。表现最好的模型是在 SQuAD v2 或 SQuAD v1 上训练的。表现最好的模型是 ahotrod/electra_large_discriminator_squad2_512,在所有数据集上实现了 43% 的准确率。我们观察到所有模型的计算时间取决于上下文长度和模型大小。模型的性能通常随答案长度的增加而下降。此外,模型的性能取决于上下文的复杂性。我们还使用遗传算法通过整合来自其他模型的响应来提高整体准确率。ahotrod/electra_large_discriminator_squad2_512 在 bioasq10b-factoid (65.92%)、 biomedical_cpgQA (96.45%)、 QuAC (11.13%) 和 Question Answer Dataset (41.6%) 上生成了最佳结果。Bert-large-uncased-whole-word-masking-finetuned-squad 在 IELTS 数据集上实现了 82% 的准确率。

关键词

引用

@article{arxiv.2512.00323,
  title  = {Comparative Analysis of 47 Context-Based Question Answer Models Across 8 Diverse Datasets},
  author = {Muhammad Muneeb and David B. Ascher and Ahsan Baidar Bakht},
  journal= {arXiv preprint arXiv:2512.00323},
  year   = {2025}
}