指令带来的差异
计算机视觉与模式识别
2024-06-14 v2 计算与语言
摘要
我们引入了指令文档视觉问答(iDocVQA)数据集和大语言文档(LLaDoc)模型,分别用于训练语言-视觉(LV)模型以进行文档分析和文档图像预测。通常,用于 DocVQA 任务的深度神经网络在缺乏指令的数据集上进行训练。我们表明,使用指令遵循数据集能提升性能。我们以最近的最先进技术(SotA)大语言与视觉助手(LLaVA)1.5 作为基础模型,比较了跨文档相关数据集的性能。我们还使用基于轮询的对象探测评估(POPE)数据集评估了衍生模型在对象幻觉方面的性能。结果表明,指令微调的性能是零样本性能的 11 倍至 32 倍,且比非指令(传统任务)微调高出 0.1% 至 4.2%。尽管有所提升,但仍未达到人类水平(94.36%),这意味着仍有很大的改进空间。
引用
@article{arxiv.2402.00453,
title = {Instruction Makes a Difference},
author = {Tosin Adewumi and Nudrat Habib and Lama Alkhaled and Elisa Barney},
journal= {arXiv preprint arXiv:2402.00453},
year = {2024}
}
备注
Accepted at the 16th IAPR International Workshop On Document Analysis Systems (DAS)