NDP:将下一分布预测作为更广泛的目标
计算与语言
2024-09-02 v1 人工智能
摘要
基于下一词元预测(NTP)范式训练的大语言模型(LLM)展现出了强大的能力。然而,现有的 NTP 范式存在若干局限性,特别是与计划任务复杂性和推理过程中的误差传播相关的问题。在我们的工作中,我们扩展了对 NTP 的批判,强调其局限性还源于训练目标的狭窄:即预测次优的独热分布。为了支持这一批判,我们进行了一项预实验,将强大 LLM 的输出分布视为高效的世界数据压缩。通过评估 LLM 中 -gram 分布与独热分布之间的相似度,我们观察到 -gram 分布与 LLM 的输出分布更为接近。基于这一洞察,我们引入了下一分布预测(NDP),使用 -gram 分布替代独热目标,在不增加额外在线训练时间的情况下增强学习。我们在翻译、通用任务、语言迁移和医学领域适配方面进行了实验。与 NTP 相比,NDP 在翻译任务中可实现高达 +2.97 的 COMET 提升,在通用任务中平均提升 +0.61,在医学领域实现了惊人的 +10.75 平均提升。这证明了解决目标窄化问题的具体收益,为未来改进 NTP 的工作指明了新方向。
引用
@article{arxiv.2408.17377,
title = {NDP: Next Distribution Prediction as a More Broad Target},
author = {Junhao Ruan and Abudukeyumu Abudula and Xinyu Liu and Bei Li and Yinqiao Li and Chenglong Wang and Yuchun Fan and Yuan Ge and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2408.17377},
year = {2024}
}
备注
8 pages,5 figures