$\textit{New News}$:面向新知识鲁棒集成的 System-2 微调
计算与语言
2025-11-17 v3 人工智能
机器学习
摘要
人类和智能动物能够内化新信息并准确地理解其含义,以完成下游任务。虽然大语言模型(LLM)可以通过将信息(新闻)显式提供为上下文进行通过情境学习(ICL)来实现这一点,但通过微调将信息内化到模型权重中仍然具有挑战性。本文引入了 New News 数据集,包含跨多个领域(数学、编码、发现、排行榜、事件)的假设性且合情合理的新闻,以及正确答案关键依赖于理解和内化新闻的下游评估问题。首先,我们在数据集上展示了草率微调与通过情境学习(FT-ICL 差距)之间的显著差距。为解决这一差距,我们探索了一套自我对弈数据生成协议——改写、含义推导和自问自答——旨在将模型通过上下文处理的知识蒸馏到模型权重中,我们将其称为 System-2 微调(Sys2-FT)。我们在 Qwen 2.5 系列模型上系统评估了 ICL 和 Sys2-FT 在不同数据领域和模型规模下的性能。我们的结果表明,Sys2-FT 的自问自答协议显著提高了模型对新闻的权重学习能力,同时保持了通用能力。此外,我们发现情境投影效应,即在上下文中使用新闻后,其改写或问答训练会严重降低对新闻的学习。最后,我们对 Sys2-FT 的新兴扩展规律提供了初步证据。
引用
@article{arxiv.2505.01812,
title = {$\textit{New News}$: System-2 Fine-tuning for Robust Integration of New Knowledge},
author = {Core Francisco Park and Zechen Zhang and Hidenori Tanaka},
journal= {arXiv preprint arXiv:2505.01812},
year = {2025}
}