UMIE:基于指令微调的统一多模态信息抽取
人工智能
2024-01-09 v1
摘要
随着多媒体内容的普及,多模态信息抽取(MIE)获得了显著关注。然而,当前的 MIE 方法通常采用任务特定的模型结构,这导致跨任务的泛化能力有限,并且未能充分利用 MIE 任务间的共享知识。为解决这些问题,我们提出了 UMIE,一个统一的多模态信息抽取器,它利用指令微调将三个 MIE 任务统一为一个生成问题,能够有效地提取文本和视觉提及。大量实验表明,我们的单一 UMIE 模型在三个任务、六个 MIE 数据集上优于各种最先进(SoTA)方法。此外,深入分析证明了 UMIE 在零样本设置下的强泛化能力、对指令变体的鲁棒性以及可解释性。我们的研究是迈向统一 MIE 模型的初步步骤,并开启了在 MIE 领域内对指令微调和大语言模型的探索。我们的代码、数据和模型可在 https://github.com/ZUCC-AI/UMIE 获取。
引用
@article{arxiv.2401.03082,
title = {UMIE: Unified Multimodal Information Extraction with Instruction Tuning},
author = {Lin Sun and Kai Zhang and Qingyuan Li and Renze Lou},
journal= {arXiv preprint arXiv:2401.03082},
year = {2024}
}