RASP-Tuner:用于非平稳环境中基于上下文的黑盒优化的检索增强软提示
机器学习
2026-04-21 v1 人工智能
摘要
许多部署系统暴露的目标函数,其最小化配置随外部观察到的上下文而变化。当上下文反复回到小集合的潜在情境时,丢弃历史的优化器会付出重复的适应成本;当每一步都必须保持廉价时,高观察计数下的完整高斯过程 (GP) 重新拟合难以维持。我们将在线调优建模为上下文条件化的后悔最小化,并提出 RASP-Tuner,其实现一种受原理驱动的分解:(i) 通过检索类似过去的上下文识别情境代理;(ii) 使用混合专家替代模型预测短期损失,其输入拼接参数、上下文和检索到的软提示;(iii) 在低维提示子空间中主要适应,仅在标量化误差或不一致性触发时才进行完整的替代模型更新。RealErrorComposer 将异构流式指标通过 EMA 稳定 logistic 分数映射到 [0,1],提供单一可微训练目标。在九个合成非平稳基准、一个对抗性情境检查以及三个真实世界数据流上,RASP-Tuner 在 T=100 的配对测试中对七个合成任务改进或匹配我们的 GP-UCB 和 CMA-ES 实现的累积后悔,同时在相同硬件上记录比滑动窗口 GP-UCB 低 8-12 倍的墙钟每步时间。理想化分析在聚类分离、强凸 regime 模型 (RA-GD) 中提供有界动态后悔的充分条件;部署的管道违反了若干这些前提条件,我们阐述了哪些差距仍待解决。
引用
@article{arxiv.2604.18026,
title = {RASP-Tuner: Retrieval-Augmented Soft Prompts for Context-Aware Black-Box Optimization in Non-Stationary Environments},
author = {Enze Pan},
journal= {arXiv preprint arXiv:2604.18026},
year = {2026}
}
备注
Withdraw by ICML and prepare for NeurIPS or ICLR