中文

MLLMs能否执行文本到图像的上下文学习?

机器学习 2024-07-23 v3 计算与语言

摘要

从大型语言模型(LLMs)到多模态大型语言模型(MLLMs)的演变,激发了将上下文学习(ICL)扩展到其多模态对应物的研究。现有的此类研究主要集中在图像到文本的ICL上。然而,文本到图像的ICL(T2I-ICL)具有其独特的特性和潜在应用,但仍未得到充分探索。为了填补这一空白,我们正式定义了T2I-ICL任务,并提出了CoBSAT,这是第一个T2I-ICL基准数据集,包含十个任务。利用我们的数据集对六个最先进的MLLMs进行基准测试,我们发现了MLLMs在解决T2I-ICL时遇到的相当大的困难。我们确定主要挑战是多模态和图像生成的固有复杂性,并表明微调和思维链提示等策略有助于缓解这些困难,从而带来性能的显著提升。我们的代码和数据集可在https://github.com/UW-Madison-Lee-Lab/CoBSAT获取。

关键词

引用

@article{arxiv.2402.01293,
  title  = {Can MLLMs Perform Text-to-Image In-Context Learning?},
  author = {Yuchen Zeng and Wonjun Kang and Yicong Chen and Hyung Il Koo and Kangwook Lee},
  journal= {arXiv preprint arXiv:2402.01293},
  year   = {2024}
}

备注

Accepted at COLM 2024