自回归序列到序列模型中的双向感知诱导
计算与语言
2024-08-27 v1
摘要
自回归序列到序列模型是许多深度学习成就的基础,涵盖视觉和自然语言处理等主要研究领域。尽管如此,仍存在显著局限性。例如,当早期预测步骤出错时,整个输出都会受到严重影响。这种对先前预测标记的依赖以及顺序算法固有的计算不友好性,促使研究者探索不同的体系结构和方法,寻找双向方法。在本工作中,我们引入了双向感知诱导(Bidirectional Awareness Induction, BAI),这是一种训练方法,利用网络中一部分元素——枢轴(Pivots)——进行双向学习,同时不破坏自回归约束。为展示其灵活性,我们将该方法应用于三个体系结构,包括 Transformer、ExpansionNet v2 和 GPT,然后在三个任务上进行实验。实验结果在所有选定的任务和体系结构上都显示 BAI 的有效性。特别是,我们在图像字幕、神经机器翻译和文本摘要等任务中分别提高了最高可达 2.4 的 CIDEr、4.96 的 BLEU 和 1.16 的 ROUGE。值得注意的是,BAI 不仅对从头训练的模型产生积极影响,而且也对预训练模型有效。这种特性结合其 absence of architectural requirements,与当前大语言模型(LLMs)的趋势相得益彰。
引用
@article{arxiv.2408.13959,
title = {Bidirectional Awareness Induction in Autoregressive Seq2Seq Models},
author = {Jia Cheng Hu and Roberto Cavicchioli and Alessandro Capotondi},
journal= {arXiv preprint arXiv:2408.13959},
year = {2024}
}