基于信息融合的黑箱模型集成用于文本和视觉问答
计算与语言
2024-12-18 v2 人工智能
摘要
开发用于解决文本和视觉问答任务的大型语言模型(LLM)(如ChatGPT)和视觉问答(VQA)模型(如BLIP)已取得多样化进展。然而,这些模型的微调要么因需通过API而难以实现,使其成为黑箱模型,要么因需调整大量参数而成本高昂。为此,我们提出InfoSel——一种数据高效的集成方法,通过信息融合动态从现有黑箱模型中选取预测获胜者,适用于文本和多模态视觉问答任务。不同于传统集成模型,InfoSel不依赖预测概率或置信度,这些通常在黑箱模型中不可用。实验结果表明,在四个数据集上,仅使用1K个训练实例,我们的方法相较于独立的LLM在F1分数上提升了最高达+5.19%。
引用
@article{arxiv.2407.12841,
title = {Black-box Model Ensembling for Textual and Visual Question Answering via Information Fusion},
author = {Yuxi Xia and Kilm Zaporojets and Benjamin Roth},
journal= {arXiv preprint arXiv:2407.12841},
year = {2024}
}
备注
15 pages, 6 figures, 9 tables