Im-Promptu:基于图像提示的上下文组合
计算机视觉与模式识别
2023-10-24 v3 人工智能
摘要
大语言模型是少样本学习者,能从少量演示中解决多样任务。这种对任务的隐式理解表明,词元上的注意力机制可能在类比推理中发挥作用。在本工作中,我们研究类比推理是否能实现视觉刺激可组合元素上的上下文组合。首先,我们引入一套三个基准来测试视觉上下文学习器的泛化特性。我们形式化了基于类比的上下文学习器的概念,并用以设计一个称为 Im-Promptu 的元学习框架。尽管语言所需的词元粒度已确立,但实现视觉刺激中上下文泛化所需的适当组合粒度通常未明确。为此,我们使用 Im-Promptu 训练了具有不同组合程度的多个智能体,包括向量表示、块表示和对象槽。我们的实验揭示了外推能力与组合程度之间的权衡:非组合表示能将学到的组合规则扩展到未见领域,但在组合任务上表现不佳;基于块的表示要求块包含完整对象才能实现稳健外推;同时,以对象为中心的 tokenizer 配合交叉注意力模块能生成一致且高保真的解决方案,这些归纳偏置对组合泛化尤为关键。最后,我们展示了 Im-Promptu 作为图像生成直观编程接口的使用案例。
引用
@article{arxiv.2305.17262,
title = {Im-Promptu: In-Context Composition from Image Prompts},
author = {Bhishma Dedhia and Michael Chang and Jake C. Snell and Thomas L. Griffiths and Niraj K. Jha},
journal= {arXiv preprint arXiv:2305.17262},
year = {2023}
}