中文

Coling-UniA 在 SciVQA 2025:基于少量示例检索和置信度感知的多模态大语言模型集成

计算与语言 2025-07-04 v1

摘要

本文描述了我们的系统用于 SciVQA 2025 共享任务上的科学视觉问答。我们的系统采用两个多模态大语言模型的集成以及各种少量示例检索策略。根据图表和问题类型选择模型和少量示例设置。我们还根据模型的置信度水平选择答案。在盲测数据上,我们的系统在七支队伆中名次位列第三,平均 F1 分数在 ROUGE-1、ROUGE-L 和 BERTS 之间为 85.12。我们的代码已公开。

关键词

引用

@article{arxiv.2507.02357,
  title  = {Coling-UniA at SciVQA 2025: Few-Shot Example Retrieval and Confidence-Informed Ensembling for Multimodal Large Language Models},
  author = {Christian Jaumann and Annemarie Friedrich and Rainer Lienhart},
  journal= {arXiv preprint arXiv:2507.02357},
  year   = {2025}
}

备注

Accepted at 5th Workshop on Scholarly Document Processing @ ACL 2025