用于分层适应的混合效应Transformer
计算与语言
2022-12-12 v2
摘要
语言使用在不同语境间差异显著。在某种程度上,像GPT-3这样的现代语言模型能够通过以一段先前输入文本或提示为条件来刻画这种差异。然而,当语境稀疏、样本外或文本外(例如,说明文本产生的时间地点或生产者)时,提示是无效的。本文中,我们引入混合效应Transformer(MET),一种学习分层结构前缀——附加在输入前的轻量模块——以刻画结构化变异的新方法。具体而言,我们展示了如何通过带dropout的正则化前缀调优过程将流行的混合效应模型类扩展到基于Transformer的架构。我们在多个领域适应基准上评估该方法,发现它能以最少的数据高效适应新语境,同时仍能有效泛化至未见语境。
引用
@article{arxiv.2205.01749,
title = {Mixed-effects transformers for hierarchical adaptation},
author = {Julia White and Noah Goodman and Robert Hawkins},
journal= {arXiv preprint arXiv:2205.01749},
year = {2022}
}