中文

面向视觉 grounding 长期信息寻求智能体的信息感知信用分配(ICA)

机器学习 2026-02-12 v1 人工智能

摘要

尽管强化学习训练的信息寻求智能体取得了卓越的性能,但在开放式 web 环境中的学习仍严重受限于低信噪比反馈。基于文本的解析器常会丢弃布局语义并引入非结构化噪声,而长期训练通常依赖稀疏的结果奖励,掩盖哪些检索动作实际上至关重要。我们提出一种视觉原生搜索框架,将网页表示为视觉快照,使智能体能够利用布局线索快速定位关键证据并抑制干扰因素。为了有效地从这些高维观察中学习,我们引入信息感知信用分配(ICA),这是一种后验分析方法,用于估计每个检索快照对最终结果的贡献,并将稠密学习信号传递回关键搜索回合。集成在基于 GRPO 的训练管道中,我们的方法在多样化的信息寻求基准测试上 consistently 优于基于文本的基线,证明了视觉快照 grounding 结合信息层次信用分配有效缓解了开放式 web 环境中的信用分配瓶颈。该代码和数据集将在 https://github.com/pc-inno/ICA_MM_deepsearch.git 发布。

关键词

引用

@article{arxiv.2602.10863,
  title  = {ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents},
  author = {Cong Pang and Xuyu Feng and Yujie Yi and Zixuan Chen and Jiawei Hong and Tiankuo Yao and Nang Yuan and Jiapeng Luo and Lewei Lu and Xin Lou},
  journal= {arXiv preprint arXiv:2602.10863},
  year   = {2026}
}