半参数 Token-Sequence 协同监督
计算与语言
2024-03-15 v1 人工智能
摘要
在这项工作中,我们引入了一种半参数 token-sequence 协同监督训练方法。它通过同时利用来自传统的下一 token 预测损失(在参数化 token 嵌入空间上计算)和下一 sequence 预测损失(在非参数化 sequence 嵌入空间上计算)的监督来训练语言模型。非参数化 sequence 嵌入空间由一个独立的语言模型构建,该模型的任务是将输入文本压缩成一个单一的代表性嵌入。我们的实验表明,通过两种监督训练的模型始终优于通过每种监督独立训练的模型。分析表明,这种协同监督鼓励了模型更广泛的泛化能力。特别是,在预训练步骤中建立的参数化 token 空间的鲁棒性,往往能有效增强非参数化 sequence 嵌入空间的稳定性,这是一个由另一个语言模型建立的新空间。
引用
@article{arxiv.2403.09024,
title = {Semiparametric Token-Sequence Co-Supervision},
author = {Hyunji Lee and Doyoung Kim and Jihoon Jun and Sejune Joo and Joel Jang and Kyoung-Woon On and Minjoon Seo},
journal= {arXiv preprint arXiv:2403.09024},
year = {2024}
}