中文

从多模态输入获取语言知识

计算与语言 2024-02-29 v1

摘要

与儿童相比,语言模型在获取语言时表现出明显较差的数据效率。在本提交给 BabyLM 挑战赛 (Warstadt 等人, 2023) 的论文中,我们检验了一个假设:这种数据效率差距部分是由于典型语言模型学习环境中缺乏多模态输入和基础。尽管先前研究这一问题的工作发现多模态训练甚至可能损害纯语言性能,但我们推测这些发现可归因于在字幕数据上微调导致复杂语言的灾难性遗忘。为检验我们的假设,我们对多模态视觉-语言模型 FLAVA (Singh 等人, 2022) 进行了消融研究,独立变化文本和视觉输入的数量,以量化在不同数据规模下视觉可以抵消多少文本数据(如果有的话)。我们旨在通过多任务预训练机制来限制灾难性遗忘,该机制包括纯文本的单模态任务以及从相对多样化的基于 Wikipedia 的数据集 WiT (Srinivasan 等人, 2021) 中采样的数据。我们的结果在很大程度上是负面的:多模态预训练不会损害我们模型的语言性能,但也没有持续地带来帮助。尽管如此,我们的结论受到我们只能进行少量运行的局限。虽然我们必须保留多模态输入可能解释语言模型与人类之间数据效率差距部分原因的可能性,但这一假设的正面证据将需要更好的多模态训练架构和技术。

关键词

引用

@article{arxiv.2402.17936,
  title  = {Acquiring Linguistic Knowledge from Multimodal Input},
  author = {Theodor Amariucai and Alex Warstadt},
  journal= {arXiv preprint arXiv:2402.17936},
  year   = {2024}
}

备注

in Proceedings of the BabyLM Challenge at the 27th Conference on Computational Natural Language Learning