多样本上下文学习在多模态基础模型中的应用
机器学习
2024-10-08 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
大型语言模型在少样本上下文学习(ICL)方面效果良好。近期,多模态基础模型的发展使得上下文窗口长度实现了 unprecedented 的提升,为探索其进行大规模样本上下文学习的能力提供了机会。本文我们评估了从少样本到大量样本 ICL 的多模态基础模型性能。我们对 GPT-4o 和 Gemini 1.5 Pro 在 14 个跨越多个领域(自然图像、医学图像、遥感图像和分子图像)和任务(图像分类、视觉问答和目标检测)的数据集上进行基准测试。我们观察到,在所有数据集上,大规模样本 ICL(包括近 2000 个示范样本)相对于少样本(<100 个示范样本)的 ICL 均表现出显著提升。进一步地,Gemini 1.5 Pro 在大多数数据集上表现出随着所测试示范样本数量增加而呈对数线性提升。我们还发现,像 Llama 3.2-Vision 这类开源权重的多模态基础模型并不受益于示范样本,这凸显了开源和闭源多模态基础模型之间的重要差距。鉴于大规模 ICL 需要高昂的推理成本,我们也探讨了在单次 API 调用中批量处理多个查询的影响。我们表明,最多可批量处理 50 个查询,在零样本和大规模 ICL 设置下均可带来性能提升,同时在多个数据集上实现显著的零样本设置下的性能提升,显著降低了每个查询的成本和延迟。最后,尽管 GPT-4o 和 Gemini 1.5 Pro 在所有数据集上实现相似的零样本性能,但在大多数数据集上,Gemini 1.5 Pro 的学习速度更快。我们的结果表明,大规模 ICL 可能使用户高效地将多模态基础模型适应到新的应用和领域。我们的 codebases 已公开于 https://github.com/stanfordmlgroup/ManyICL。
引用
@article{arxiv.2405.09798,
title = {Many-Shot In-Context Learning in Multimodal Foundation Models},
author = {Yixing Jiang and Jeremy Irvin and Ji Hun Wang and Muhammad Ahmed Chaudhry and Jonathan H. Chen and Andrew Y. Ng},
journal= {arXiv preprint arXiv:2405.09798},
year = {2024}
}