论稳定长篇生成:基准测试与长度波动缓解
计算与语言
2026-05-05 v1
摘要
大型语言模型(LLM)在长上下文理解方面表现出色,但在长篇生成中存在显著局限。现有研究主要聚焦于单次生成质量,普遍忽视了输出的波动性。这种波动性不仅导致显著的计算成本,也严重影响模型可靠的应用。为此,我们的工作分为三个阶段:基准测试、探针与缓解。首先,我们提出 VOlatility in Long-form Text Benchmark(VOLTBench),一个新型异构任务基准,用于系统性量化长篇生成的 length volatility。随后通过分析注意力轨迹,我们深入探针识别了导致此类波动的若干常见内部模式。最后,为缓解长篇输出波动,我们提出 Stable Generation via Logits Boosting(GLoBo),这是一种轻量级的解码阶段优化策略,旨在无需额外训练地显著提升长篇生成的 length accuracy 与稳定性。广泛的实验在 VOLTBench 上提供了对主流模型长篇输出不稳定性的首个系统性确认,并验证了我们提出的方法成功提升了 base model 输出长度的平均值 148%,降低了 length volatility 69%,同时保持高的生成质量。
引用
@article{arxiv.2605.01357,
title = {On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility},
author = {Zhitao He and Haolin Yang and Rui Min and Zeyu Qin and Yi R. Fung},
journal= {arXiv preprint arXiv:2605.01357},
year = {2026}
}