视觉语言导航中自我改进代理的平衡之 essence
计算机视觉与模式识别
2026-04-22 v1
摘要
在视觉语言导航 (VLN) 中,仅使用标准 VLN 动作监督,从策略诱导的经验进行自我改进,严重依赖于平衡行为多样性和学习稳定性,这决定了代理能否提取可靠的学习信号以进行改进。增加行为多样性是必要的,以暴露备选动作假设,但可能会 destabilize 策略诱导的学习信号,而过于保守的稳定性约束则抑制探索并导致早期承诺,使得可靠的自我改进困难。为解决这一挑战,我们提出 Stability-Diversity Balance (SDB),这是一种用于 VLN 中平衡自我改进的即插即用机制。SDB 通过对指令条件化的隐藏状态应用受控偏移,将每个决策步骤扩展为多个潜在行为假设,然后进行可靠性感知的软评估和聚合,以在学习期间保留多样且与指令一致的替代方案。进一步的显式正则化约束了假设之间的相互作用,防止过度漂移或过早假设多样性的坍缩,并在不丢弃训练信号的情况下稳定自我改进。在 R2R、SOON 和 REVERIE 上的实验显示出一致的改进;例如,在 REVERIE val-unseen 上,SDB 将 SPL 从 33.73 提升到 35.93,将 OSR 从 51.07 提升到 54.25。
引用
@article{arxiv.2604.19064,
title = {The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation},
author = {Zhen Liu and Yuhan Liu and Jinjun Wang and Jianyi Liu and Wei Song and Jingwen Fu},
journal= {arXiv preprint arXiv:2604.19064},
year = {2026}
}