中文

Think-While-Generate:面向个性化长篇生成的即时推理框架

计算与语言 2026-03-06 v3

摘要

偏好对齐已使大型语言模型 (LLM) 更能反映人类期望,但当前方法大多针对人群水平偏好进行优化,忽略个体用户。个人化至关重要,但早期方法——如提示词定制或微调——难以推理隐式偏好,限制了实际效果。最近的“思考-生成”方法通过在响应生成前进行推理来解决此问题,但在长篇生成中面临挑战:其静态一次性推理必须捕获完整响应生成的所有相关信息,这使得学习困难,限制了对不断演变内容的适应性。为此,我们提出 FlyThinker,一个面向个性化长篇生成的高效“生成时思考”框架。FlyThinker 采用独立的推理模型并行生成潜在 token 级别的推理内容,将其融合到生成模型中以动态指导响应生成。此设计使推理和生成能够并行运行,确保推理效率。此外,推理模型仅依赖于先前的响应而非自身 prior 输出,这保留了训练中不同位置的并行性——允许像标准 LLM 训练一样在单次前向传播中生成所有推理 token,确保训练效率。大量实验在真实基准上表明,FlyThinker 在保持训练和推理效率的同时实现了更好的个性化生成。我们的代码可在 https://github.com/wcb0219-sketch/FlyThinker.git 查看。

关键词

引用

@article{arxiv.2512.06690,
  title  = {Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation},
  author = {Chengbing Wang and Yang Zhang and Wenjie Wang and Xiaoyan Zhao and Fuli Feng and Xiangnan He and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2512.06690},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026