中文

通过生成与细化改进下一Token预测:预测倒数第二个Token

计算与语言 2025-02-17 v2 机器学习

摘要

像GPT这样的自回归语言模型旨在预测下一个token,而像BERT这样的自编码模型则训练于预测掩码token等任务。我们训练了一个仅解码器架构的模型,用于预测一个token序列的倒数第二个token。与BERT风格的模型相比,我们的方法采用结构化的token掩码策略,从而在训练效率上更具优势。我们使用我们的模型,通过将两种预测结合在一种“生成-细化”方法中,来改进标准GPT的下一token预测。我们在GPT-2的不同变体和不同数据集上证明(毫不意外地),倒数第二个token的预测比标准下一token预测准确得多,准确率提高了15%以上。“生成-细化”方法在下一token预测中也显示出显著的改进,虽然提升幅度较小,但一致且显著。

关键词

引用

@article{arxiv.2411.15661,
  title  = {Improving Next Tokens via Second-to-Last Predictions with Generate and Refine},
  author = {Johannes Schneider},
  journal= {arXiv preprint arXiv:2411.15661},
  year   = {2025}
}

备注

Accepted at Intelligent Data Analysis (IDA), 2025, held in Konstanz, Germany