中文

通过反馈机制让大语言模型学习从流式经验中综合生成

人工智能 2026-05-29 v1

摘要

大型语言模型(LLM)已被广泛用于合成数据生成,显著降低了标注成本。然而,大多数现有研究将生成视为独立任务,忽视了一个更根本的问题:模型是否可以通过积累过去任务的经验并将其迁移到未来任务来学习生成。在本工作中,我们引入了StreamSynth,即一种新的设置,其中合成任务按顺序到达,历史任务的经验为未来合成提供信息性信号。为解决这一设置,我们提出了SynLearner框架,使合成模型能够在任务流上获取可复用的合成经验。与为每个任务独立生成数据不同,SynLearner鼓励模型探索多样的合成模式、从反馈中学习,并在任务演变过程中平衡样本质量与集合级多样性。广泛的实验表明,SynLearner有效地利用早期任务的经验来提高后续任务的合成性能,表现出一致的跨任务可迁移性。这些发现为StreamSynth的可行性提供了证据,并将合成数据生成视为一个以经验为驱动的过程,这一过程可以从任务流中受益。

关键词

引用

@article{arxiv.2605.29940,
  title  = {Make LLM Learn to Synthesize from Streaming Experiences through Feedback},
  author = {Zhenlin Hu and Yan Wang and Zhen Bi and Zihao Xue and Bingyu Zhu and Longtao Huang and Xiongtao Zhang and Zeyu Yang and Zhixuan Chu and Jungang Lou},
  journal= {arXiv preprint arXiv:2605.29940},
  year   = {2026}
}