中文

Uni-NLX:统一视觉与视觉-语言任务的自然语言解释

计算机视觉与模式识别 2023-09-20 v2

摘要

自然语言解释(NLE)旨在以人类友好的自然文本补充模型的预测。现有的 NLE 方法需要为每个下游任务训练独立的模型。在本工作中,我们提出 Uni-NLX,一个统一框架,利用文本生成的统一训练目标将所有 NLE 任务整合为单一紧凑的多任务模型。此外,我们引入两个新的 NLE 数据集:1)ImageNetX,一个包含 144K 样本、用于解释 ImageNet 类别的数据集;2)VQA-ParaX,一个包含 123K 样本、用于解释视觉问答(VQA)任务的数据集。两个数据集均借助大语言模型(LLMs)构建。通过在 1M 合并的 NLE 样本上训练,我们的单一统一框架能够同时执行七项 NLE 任务,包括 VQA、视觉识别与视觉推理任务,参数数量减少 7 倍,展现出与先前方法中独立任务特定模型相当的性能,并在某些任务上甚至超越它们。代码见 https://github.com/fawazsammani/uni-nlx

关键词

引用

@article{arxiv.2308.09033,
  title  = {Uni-NLX: Unifying Textual Explanations for Vision and Vision-Language Tasks},
  author = {Fawaz Sammani and Nikos Deligiannis},
  journal= {arXiv preprint arXiv:2308.09033},
  year   = {2023}
}

备注

Accepted to ICCVW 2023