Bifrost:引导策略轨迹以弥合上下文差距,实现智能体自我改进
机器学习
2026-02-06 v1
摘要
自主智能体通过反思和迭代细化在自我改进方面表现出色,这些方法重用成功的任务轨迹作为上下文示例,以辅助后续推理。然而,跨任务切换常常引入上下文不匹配。因此,现有方法要么丢弃轨迹,要么使用启发式方法对其进行操作,导致不可忽略的微调成本或无法保证的性能。为了弥合这一差距,我们揭示了上下文-轨迹相关性,其中上下文的转变与轨迹的转变高度平行。基于这一发现,我们提出了Bifrost(BrIdge contextual gap FoR imprOvised trajectory STeering),一种无需训练的方法,利用上下文差异来精确引导先前已解决轨迹向目标任务适应,从而减轻由上下文转变引起的错位。我们的轨迹适应在表示层面使用智能体隐藏状态进行,确保轨迹转换在共享空间中与目标上下文精确对齐。在多个基准测试中,Bifrost始终优于现有的轨迹重用和微调自我改进方法,证明智能体即使在上下文发生显著转变的情况下也能有效利用过去的经验。
引用
@article{arxiv.2602.05810,
title = {Bifrost: Steering Strategic Trajectories to Bridge Contextual Gaps for Self-Improving Agents},
author = {Quan M. Tran and Zhuo Huang and Wenbin Zhang and Bo Han and Koji Yatani and Masashi Sugiyama and Tongliang Liu},
journal= {arXiv preprint arXiv:2602.05810},
year = {2026}
}