中文

Hansel:面向大语言模型的输出长度控制框架

计算与语言 2024-12-19 v1 机器学习

摘要

尽管大语言模型(LLMs)取得了巨大成功,但高效控制输出序列长度仍然是一个挑战。本文提出Hansel,一种高效的LLM长度控制框架,且不影响其生成能力。Hansel利用周期性输出的隐藏特殊标记来跟踪输出序列的剩余目标长度。结合避免输出突然终止的技术,这种看似简单的方法被证明高效且通用,同时不损害生成文本的连贯性和流畅性。该框架可应用于任何预训练LLM的微调阶段,无论其原始位置编码方法如何。我们通过使用Hansel微调四个不同的LLM来证明这一点,并表明与基于提示的长度控制微调相比,每个模型和数据集的输出序列平均绝对误差均显著降低。此外,该框架展现出对外推至微调期间未见的目标长度(如长对话响应或极短摘要)的显著改进能力。这表明模型学习了长度控制的一般方法,而非仅仅匹配训练期间看到的输出长度。

关键词

引用

@article{arxiv.2412.14033,
  title  = {Hansel: Output Length Controlling Framework for Large Language Models},
  author = {Seoha Song and Junhyun Lee and Hyeonmok Ko},
  journal= {arXiv preprint arXiv:2412.14033},
  year   = {2024}
}

备注

13 pages, 6 figures; accepted to AAAI-25