中文

Apollo:基于多专家协作的零样本多模态推理

计算与语言 2023-10-31 v1 人工智能 计算机视觉与模式识别

摘要

我们提出了一种模块化框架,利用不同基础模型在不同模态与领域上的专长,来执行单一的复杂多模态任务,而无需依赖提示工程或专门定制的多模态训练。我们的方法支持去中心化指令执行,并允许每个模型既贡献自身专长又从其他模型的专长中获益。由于不依赖提示,我们的方法可扩展到多种基础模型(包括音频与视觉模型),而不仅限于语言模型。我们在两项任务上展示了该方法。在知名的风格化图像描述任务上,实验表明我们的方法优于半监督的当前最优(SOTA)模型,同时具备零样本特性,并避免了昂贵的训练、数据收集和提示工程。我们进一步在一项新任务——音频感知图像描述上验证了该方法:给定图像与音频,任务是生成在所给音频语境下描述该图像的文字。我们的代码已在 GitHub 上发布。

关键词

引用

@article{arxiv.2310.18369,
  title  = {Apollo: Zero-shot MultiModal Reasoning with Multiple Experts},
  author = {Daniela Ben-David and Tzuf Paz-Argaman and Reut Tsarfaty},
  journal= {arXiv preprint arXiv:2310.18369},
  year   = {2023}
}

备注

GitHub: https://github.com/danielabd/Apollo-Cap