Jaeger:一种基于拼接的多 Transformer VQA 模型
计算与语言
2023-10-20 v2 人工智能
摘要
基于文档的视觉问答在语言歧义消解与细粒度多模态检索之间构成一项具挑战性的任务。尽管借助大语言模型与开放世界先验模型的使用,文档问答已取得令人鼓舞的进展,若干挑战依然存在,包括响应时间长、推理耗时长以及匹配不精确。为克服这些挑战,我们提出 Jaeger,一种基于拼接的多 Transformer VQA 模型。为提取问题特征,我们利用 RoBERTa large 与 GPT2-xl 作为特征提取器的卓越能力。随后,我们将两模型输出进行拼接处理。该操作使模型能同时考量来自不同来源的信息,增强其表征能力。通过利用预训练模型进行特征提取,我们的方法有望借拼接放大这些模型的性能。拼接后,我们对输出特征降维,降低模型计算开销与推理时间。实证结果表明,我们所提模型在 PDF-VQA 数据集的 Task C 上取得具竞争力的性能。若用户添加任何新数据,应确保按前文所提供的指令样式化处理。
引用
@article{arxiv.2310.07091,
title = {Jaeger: A Concatenation-Based Multi-Transformer VQA Model},
author = {Jieting Long and Zewei Shi and Penghao Jiang and Yidong Gan},
journal= {arXiv preprint arXiv:2310.07091},
year = {2023}
}
备注
This paper is the technical research paper of CIKM 2023 DocIU challenges. The authors received the CIKM 2023 DocIU Winner Award, sponsored by Google, Microsoft, and the Centre for data-driven geoscience