基于自合成的测试时元适应
机器学习
2026-03-10 v2 人工智能
摘要
作为强大的通用推理模型,大语言模型(LLMs)在遇到多样化的领域和任务时,具备在推理期间自我适应和自我改进的能力,这是一项宝贵的能力。我们引入了 MASS,这是一个元学习框架,使 LLMs 能够通过生成特定问题的合成训练数据并在推理时进行针对性的自更新,以实现自适应。我们通过双层优化 end-to-end 训练这种行为:内层循环在自生成的示例上进行适应,而外层循环则元学习数据归因信号和更新后任务性能的奖励。合成数据通过可扩展的元梯度进行优化,将下游损失反向传播通过内层更新,以奖励有用的生成。在数学推理实验中,MASS 学习了为实现有效且数据高效的测试时适应而生成逐实例课程的能力。
引用
@article{arxiv.2603.03524,
title = {Test-Time Meta-Adaptation with Self-Synthesis},
author = {Zeyneb N. Kaya and Nick Rui},
journal= {arXiv preprint arXiv:2603.03524},
year = {2026}
}
备注
5 pages, 2 figures, 1 table. Accepted to AI with Recursive Self-Improvement (RSI) Workshop @ ICLR 2026