中文

CUE 向量:基于多样上下文信号调节语言模型的模块化训练

计算与语言 2024-02-09 v1

摘要

我们提出一种框架,通过消除联合训练句外上下文编码器与句内编码器的需求,将使用多种句外上下文(包括元数据)的神经语言模型训练模块化。我们的方法——上下文通用嵌入(CUE)——在如日期和作者等一组上下文上训练语言模型(LM),并适应如文章标题或前一句等新颖元数据类型。该模型由一个预训练神经句子 LM、一个基于 BERT 的上下文编码器,以及一个利用句内与句外信息估计 LM 概率的掩码 transformer 解码器组成。当上下文或元数据不可用时,我们的模型学习使用带噪预言 unigram 嵌入作为代理来结合上下文与句内信息。真实的上下文信息可在后续引入,并用于适配少量将上下文数据映射至解码器嵌入空间的参数。我们在具有多种元数据类型的 NYTimes 文本语料库上验证 CUE 框架,通过以上下文为条件可将 LM 困惑度从 36.6 降至 27.4。在训练期间仅以上下文/元数据子集引导上下文 LM 可保留可达增益的 85%。使用代理上下文初始训练模型,在适配真实上下文后保留 67% 的困惑度增益。此外,我们可在不重新训练上下文编码器的情况下,仅通过适配解码器模型将一种预训练句子 LM 替换为另一种。总体而言,我们获得了一个允许增量式、可扩展地训练上下文增强 LM 的模块化框架。

关键词

引用

@article{arxiv.2203.08774,
  title  = {CUE Vectors: Modular Training of Language Models Conditioned on Diverse Contextual Signals},
  author = {Scott Novotney and Sreeparna Mukherjee and Zeeshan Ahmed and Andreas Stolcke},
  journal= {arXiv preprint arXiv:2203.08774},
  year   = {2024}
}

备注

To appear in Findings of ACL 2022