中文

WhisBERT:基于1亿词的多模态文本-音频语言建模

计算与语言 2023-12-08 v2 人工智能

摘要

在多种输入模态上进行训练可以增强语言模型的能力。在此,我们探究这种训练方式是否也能提升这些系统的质量和效率。我们聚焦于文本-音频,并引入WhisBERT,其灵感来源于FLAVA(Singh et al., 2022)的文本-图像方法。根据Babylm指南(Warstadt et al., 2023),我们在一个仅包含1亿词及其对应语音(来自People's Speech数据集(Galvez et al., 2021)的词对齐版本)的数据集上预训练WhisBERT。为评估多模态的影响,我们比较了仅在文本上训练与同时在音频和文本上训练的模型版本。我们发现,虽然WhisBERT在多模态掩码建模上表现良好,并在大多数基准任务中超越了Babylm基线,但它难以优化其复杂目标,并超越其纯文本WhisBERT基线。

关键词

引用

@article{arxiv.2312.02931,
  title  = {WhisBERT: Multimodal Text-Audio Language Modeling on 100M Words},
  author = {Lukas Wolf and Greta Tuckute and Klemen Kotar and Eghbal Hosseini and Tamar Regev and Ethan Wilcox and Alex Warstadt},
  journal= {arXiv preprint arXiv:2312.02931},
  year   = {2023}
}

备注

Published at the BabyLM Challenge, a shared task co-sponsored by CMCL 2023 and CoNLL 2023, hosted by EMNLP 2023