BatGPT:一种基于生成式预训练Transformer的双向自回归对话模型
计算与语言
2023-08-16 v2
摘要
BatGPT 是由武汉大学和上海交通大学联合设计与训练的大规模语言模型。它能够针对包括文本提示、图像和音频在内的各类输入生成高度自然流畅的文本。在建模层面,我们采用双向自回归架构,使模型能够高效捕捉自然语言的复杂依赖关系,从而在语言生成、对话系统和问答等任务中极为有效。此外,双向自回归建模不仅从左向右进行,也从右向左进行,有效降低了固定记忆效应并缓解了模型幻觉。在训练方面,我们提出一种新颖的参数扩展方法以利用较小模型的预训练,并采用来自 AI 与人类反馈的强化学习,旨在提升模型的对齐性能。总体而言,这些方法显著提升了 BatGPT 的有效性,该模型可用于广泛的自然语言应用。
引用
@article{arxiv.2307.00360,
title = {BatGPT: A Bidirectional Autoregessive Talker from Generative Pre-trained Transformer},
author = {Zuchao Li and Shitou Zhang and Hai Zhao and Yifei Yang and Dongjie Yang},
journal= {arXiv preprint arXiv:2307.00360},
year = {2023}
}