Uni-NLX:统一视觉与视觉-语言任务的自然语言解释
计算机视觉与模式识别
2023-09-20 v2
摘要
自然语言解释(NLE)旨在以人类友好的自然文本补充模型的预测。现有的 NLE 方法需要为每个下游任务训练独立的模型。在本工作中,我们提出 Uni-NLX,一个统一框架,利用文本生成的统一训练目标将所有 NLE 任务整合为单一紧凑的多任务模型。此外,我们引入两个新的 NLE 数据集:1)ImageNetX,一个包含 144K 样本、用于解释 ImageNet 类别的数据集;2)VQA-ParaX,一个包含 123K 样本、用于解释视觉问答(VQA)任务的数据集。两个数据集均借助大语言模型(LLMs)构建。通过在 1M 合并的 NLE 样本上训练,我们的单一统一框架能够同时执行七项 NLE 任务,包括 VQA、视觉识别与视觉推理任务,参数数量减少 7 倍,展现出与先前方法中独立任务特定模型相当的性能,并在某些任务上甚至超越它们。代码见 https://github.com/fawazsammani/uni-nlx
引用
@article{arxiv.2308.09033,
title = {Uni-NLX: Unifying Textual Explanations for Vision and Vision-Language Tasks},
author = {Fawaz Sammani and Nikos Deligiannis},
journal= {arXiv preprint arXiv:2308.09033},
year = {2023}
}
备注
Accepted to ICCVW 2023