中文

测试时自我提升的大语言模型代理

机器学习 2025-10-10 v1 人工智能 计算与语言

摘要

语言模型 (LM) 微调的一个范式依赖于创建大型训练数据集,假设高数量和多样性将使模型在事后训练后泛化到新任务。实际中,获取大型数据集效率低下,训练成本高昂;更糟的是,结果模型并不一定能处理复杂情境或更好地泛化。此外,现有技术很少评估训练样本是否提供新信息或与模型已获取的知识冗余,导致不必要的成本。本文探索一种新的测试时自我提升方法,以创建更有效、更具可泛化性的代理式 LM。该提议算法可概括为三个步骤:(i) 首先识别模型难以处理的样本 (自我意识),(ii) 然后从检测到的不确定样本生成相似示例 (自我数据增强),(iii) 在测试时使用这些新生成的样本进行微调 (自我提升)。我们研究了两种该方法的变体:测试时自我提升 (TT-SI),其中同一模型从自身不确定案例生成额外训练示例并从中学习;以及与测试时蒸馏 (TT-D) 的对比,后者由更强模型为不确定案例生成相似示例,使学生能够通过蒸馏监督进行适应。跨不同代理基准的实证评估表明,TT-SI 在所有基准上平均提升 5.48% 绝对准确率,同时使用 68 倍更少的训练样本便超越了其他标准学习方法。我们的发现凸显了 TT-SI 的前景,表明测试时自我提升算法作为构建更具自我演化能力的代理的新范式具有潜力。

关键词

引用

@article{arxiv.2510.07841,
  title  = {Self-Improving LLM Agents at Test-Time},
  author = {Emre Can Acikgoz and Cheng Qian and Heng Ji and Dilek Hakkani-Tür and Gokhan Tur},
  journal= {arXiv preprint arXiv:2510.07841},
  year   = {2025}
}