中文

LARFT:面向长度指令跟随的大型语言模型认知-行动闭环

计算与语言 2026-03-23 v1 人工智能

摘要

尽管大型语言模型(LLMs)在复杂指令跟随任务上表现出色,但对输出长度精确控制仍是一个持续的挑战。现有方法主要通过外部施加长度信号或优化目标来强制执行长度约束,而基本上忽视了模型内在认知长度能力的不足。为此,我们提出 LARFT(Length-Aware Reinforcement Fine-Tuning,长度感知强化微调),一种将模型的长度认知与行动紧密对齐的训练框架。具体而言,LARFT 将长度导向的强化学习与 hindsight(事后)长度意识相结合。通过将 on-policy 数据转化为事后自我意识任务,模型学习识别自身生成内容的实际长度,LARFT 同时优化模型内部的长度信息表示与其策略,以满足长度约束,从而实现精确可靠的长度指令跟随。广泛的实验在四个基础模型上进行,表明 LARFT 在三个长度指令跟随基准测试中平均提升 20.92 分点,仅在四个通用能力基准测试中下降 1.45 分点。

关键词

引用

@article{arxiv.2603.19255,
  title  = {LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models},
  author = {Wei Zhang and Lintong Du and Yuanhe Zhang and Zhenhong Zhou and Kun Wang and Li Sun and Sen Su},
  journal= {arXiv preprint arXiv:2603.19255},
  year   = {2026}
}

备注

19 pages, 6 figures