中文

XDBERT:从跨模态系统向 BERT 蒸馏视觉信息以改进语言理解

计算与语言 2022-05-04 v3 人工智能 机器学习

摘要

基于 Transformer 的模型在自然语言理解(NLU)任务中被广泛使用,多模态 Transformer 在视觉-语言任务中行之有效。本研究探索从预训练多模态 Transformer 向预训练语言编码器蒸馏视觉信息。我们的框架受跨模态编码器在视觉-语言任务中成功的启发,同时我们改变学习目标以迎合 NLU 语言主导的特性。在经过少量额外适配步骤训练并微调后,所提出的 XDBERT(跨模态蒸馏 BERT)在通用语言理解评估(GLUE)、对抗生成情境(SWAG)基准和可读性基准上优于预训练 BERT。我们分析 XDBERT 在 GLUE 上的表现,表明其提升很可能源于视觉接地。

关键词

引用

@article{arxiv.2204.07316,
  title  = {XDBERT: Distilling Visual Information to BERT from Cross-Modal Systems to Improve Language Understanding},
  author = {Chan-Jan Hsu and Hung-yi Lee and Yu Tsao},
  journal= {arXiv preprint arXiv:2204.07316},
  year   = {2022}
}

备注

ACL 2022