文本越长需求越大:推理时训练助力长文本生成
计算与语言
2024-09-12 v3 人工智能
摘要
长文本生成,例如在极长上下文下的小说写作和语篇级翻译,对当前的语言模型提出了重大挑战。现有方法主要侧重于通过长度外推等策略扩展模型的上下文窗口。然而,这些方法在训练和/或推理阶段需要大量的硬件资源。我们提出的方法 Temp-Lora 引入了一种替代概念。我们不依赖 KV 缓存来存储所有上下文信息,而是将这些信息直接嵌入到一个临时的 Lora 模块中。在长文本生成过程中,该模块使用先前生成的文本进行渐进式训练。这种方法不仅有效地保留了上下文知识,而且由于该模块在生成后被丢弃,从而防止了对模型参数的任何永久性更改。在 PG19 语言建模基准和 GuoFeng 语篇级翻译基准上的大量实验验证了 Temp-Lora 的有效性。我们的结果表明:1) Temp-Lora 显著提升了长文本的生成质量,在 PG19 的一个子集上困惑度(PPL)降低了 13.2%,在 GuoFeng 的一个子集上 PPL 降低了 29.3% 且 BLEU 分数提高了 113.2%;2) Temp-Lora 兼容并增强了大多数现有的长文本生成方法;3) Temp-Lora 可以通过缩短上下文窗口大幅降低计算成本。例如,我们可以在确保生成质量适度提升(PPL 降低 3.8%)的同时,使内存使用量减少 51.5%,推理延迟降低 60.0%。
引用
@article{arxiv.2401.11504,
title = {With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text Generation},
author = {Y. Wang and D. Ma and D. Cai},
journal= {arXiv preprint arXiv:2401.11504},
year = {2024}
}
备注
COLM 2024