苏格拉底模型:通过语言组合零样本多模态推理
计算机视觉与模式识别
2022-05-30 v2 人工智能
计算与语言
机器学习
摘要
大型预训练(例如“基础”)模型根据其训练数据的领域不同而表现出不同的能力。尽管这些领域是通用的,但它们可能仅有极小的重叠。例如,视觉-语言模型(VLM)在互联网规模的图像描述上训练,而大型语言模型(LM)进一步在互联网规模的无图像文本(例如电子表格、SAT考题、代码)上训练。因此,这些模型在不同领域中存储了不同形式的常识知识。在这项工作中,我们表明这种多样性是互补的,并且可以通过苏格拉底模型(SMs)加以利用:一个模块化框架,其中多个预训练模型可以零样本组合,即通过多模态信息提示,相互交换信息并捕获新的多模态能力,而无需微调。只需极少的工程,SMs不仅与最先进的零样本图像描述与视频到文本检索方法具有竞争力,还支持新的应用,如(i)回答关于自我中心视频的自由形式问题,(ii)通过与外部API和数据库(例如网络搜索)接口,与人进行多模态辅助对话(例如用于烹饪食谱),以及(iii)机器人感知与规划。
引用
@article{arxiv.2204.00598,
title = {Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language},
author = {Andy Zeng and Maria Attarian and Brian Ichter and Krzysztof Choromanski and Adrian Wong and Stefan Welker and Federico Tombari and Aveek Purohit and Michael Ryoo and Vikas Sindhwani and Johnny Lee and Vincent Vanhoucke and Pete Florence},
journal= {arXiv preprint arXiv:2204.00598},
year = {2022}
}
备注
https://socraticmodels.github.io/