中文

多模态语言模型当前挑战的可视化巡览

计算与语言 2022-10-25 v1 机器学习

摘要

在大规模文本语料上训练的 Transformer 模型已成为广泛自然语言处理任务的事实标准模型。然而,为功能词学习有效词表示仍具挑战性。将 Transformer 模型在图像上进行视觉接地(visually ground)的多模态学习可在一定程度上克服这些挑战;然而,仍有大量工作待完成。在本研究中,我们借助采用多模态模型进行文本到图像生成的稳定扩散(stable diffusion)模型,探究视觉接地在多大程度上促进功能词的习得。在七类功能词及众多子类中,我们发现稳定扩散模型仅能有效建模极小部分功能词——少数代词子类与关系词。我们希望我们的发现能激发新数据集与方法的开发,使多模态模型学习更好的功能词表示。

关键词

引用

@article{arxiv.2210.12565,
  title  = {A Visual Tour Of Current Challenges In Multimodal Language Models},
  author = {Shashank Sonkar and Naiming Liu and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:2210.12565},
  year   = {2022}
}