中文

学习组合不同编码器层表示以改进组合泛化能力

计算与语言 2023-10-19 v2

摘要

近期研究表明,序列到序列(seq2seq)模型难以应对组合泛化(CG),即系统地将已见组件的新颖组合进行泛化的能力。越来越多的证据表明,阻碍 CG 的原因之一在于编码器最顶层的表示是纠缠的,即序列的句法表示和语义表示相互纠缠。然而,我们认为先前识别的表示纠缠问题不够全面。此外,我们假设传入不同解码器层的源键和值表示也是纠缠的。从这一直觉出发,我们提出 \textsc{CompoSition}(\textbf{Compo}se \textbf{S}yntactic and Semant\textbf{i}c Representa\textbf{tion}s),作为 seq2seq 模型的扩展,它学习针对不同任务动态组合不同编码器层的表示,因为近期研究揭示 Transformer 编码器的底层包含更多句法信息,而顶层包含更多语义信息。具体而言,我们在编码器与解码器之间引入一个\textit{组合层},以组合不同编码器层的表示,生成传入不同解码器层的特定键和值。\textsc{CompoSition} 在两个全面且现实的基准上取得了有竞争力的结果,从经验上证明了我们方法的有效性。代码见~\url{https://github.com/thinkaboutzero/COMPOSITION}。

关键词

引用

@article{arxiv.2305.12169,
  title  = {Learning to Compose Representations of Different Encoder Layers towards Improving Compositional Generalization},
  author = {Lei Lin and Shuangtao Li and Yafang Zheng and Biao Fu and Shan Liu and Yidong Chen and Xiaodong Shi},
  journal= {arXiv preprint arXiv:2305.12169},
  year   = {2023}
}

备注

Accepted by Findings of EMNLP 2023