Dynamic Cheatsheet:基于自适应记忆的测试时学习
机器学习
2025-04-11 v1 计算与语言
摘要
尽管在复杂任务上表现出色,当前的语言模型通常在孤立状态下运行:每个输入查询被单独处理,而不保留来自先前尝试的见解。在此,我们提出了 Dynamic Cheatsheet(DC),一个赋予黑盒 LM 持久、演化记忆的轻量级框架。DC 无需反复重新发现或重新提交相同的解决方案和错误,而是使模型能够在推理时存储和重用累积的策略、代码片段和通用问题解决见解。这种测试时学习在一系列任务上显著提升了性能,而无需显式的真实标签或人类反馈。利用 DC,Claude 3.5 Sonnet 在 AIME 数学考试上的准确率提升了一倍以上,因为它开始在不同问题间保留代数见解。类似地,GPT-4o 在 Game of 24 上的成功率从 10% 提升至 99%,此前该模型发现并重用了基于 Python 的解决方案。在容易出现算术错误的任务(如配平方程式)中,DC 使 GPT-4o 和 Claude 能够通过调用先前验证过的代码达到接近完美的准确率,而它们的基线停滞在 50% 左右。除了算术挑战之外,DC 在需要知识的任务上也带来了显著的准确率提升。Claude 在 GPQA-Diamond 上取得了 9% 的提升,在 MMLU-Pro 问题上取得了 8% 的提升。至关重要的是,DC 的记忆是自我管理的,专注于简洁、可迁移的片段,而不是整个记录。与微调或静态检索方法不同,DC 能即时调整 LM 的问题解决技能,而无需修改其底层参数。总体而言,我们的研究结果表明 DC 是一种用持久记忆增强 LM 的有前途的方法,弥合了孤立推理事件与人类认知特有的累积的、经验驱动的学习之间的鸿沟。
引用
@article{arxiv.2504.07952,
title = {Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory},
author = {Mirac Suzgun and Mert Yuksekgonul and Federico Bianchi and Dan Jurafsky and James Zou},
journal= {arXiv preprint arXiv:2504.07952},
year = {2025}
}
备注
https://github.com/suzgunmirac/dynamic-cheatsheet