中文

论深度上下文语言模型的通用性

计算与语言 2021-12-21 v2

摘要

像 ELMO、BERT 及其后继者这样的深度上下文语言模型(LM)主导了自然语言处理的格局,因为它们能够通过预训练单一模型然后针对任务进行微调,快速扩展到多个任务。此外,诸如 XLM-R 和 mBERT 此类模型的多语言版本在零样本跨语言迁移中给出了有前景的结果,潜在地使许多服务不足和资源不足的语言中的 NLP 应用成为可能。由于这一初步成功,预训练模型正被用作“通用语言模型”,作为跨不同任务、领域和语言的起点。本工作通过识别通用模型应当能够扩展的七个维度(即在这些维度上表现同样好或相当好,以在不同环境中发挥作用)来探讨“通用性”的概念。我们概述了支持这些维度上模型性能的当前理论与实证结果,以及可能有助于解决其当前某些局限性的扩展。通过本综述,我们为理解大规模上下文语言模型的能力与局限性奠定基础,并有助于辨别研究空白与未来工作方向,以使这些 LM 对多样化应用、用户和语言现象具有包容性和公平性。

关键词

引用

@article{arxiv.2109.07140,
  title  = {On the Universality of Deep Contextual Language Models},
  author = {Shaily Bhatt and Poonam Goyal and Sandipan Dandapat and Monojit Choudhury and Sunayana Sitaram},
  journal= {arXiv preprint arXiv:2109.07140},
  year   = {2021}
}

备注

9 pages