ContextNav:面向代理式多模态情境学习
人工智能
2025-10-07 v1
摘要
近期的进展表明,多模态大语言模型(MLLM)展现出强大的多模态情境学习(in-context learning, ICL)能力,能够从少量情境示例中适应新颖的视觉语言任务。然而,现有 ICL 方法在可扩展性与鲁棒性之间面临挑战:人工选择示例可获得干净的情境,但代价是高昂且任务依赖;而基于相似性的检索提升了可扩展性,但可能引入无关或结构不一致的样本,导致 ICL 性能下降。为此,我们提出 ContextNav——首个集成自动检索可扩展性与人类化精选质量和适应性的代理式框架,实现多模态 ICL 的噪声鲁棒和动态优化情境化。ContextNav 在由图基编排驱动的闭环工作流程中统一了情境管理与噪声鲁棒化。具体而言,它构建资源感知的多模态嵌入管道,维护可检索的向量数据库,并应用代理式检索与结构对齐以构建抗噪声情境。进一步地,操作语法图(OGG)支持自适应工作流程规划与优化,使代理能够基于下游 ICL 反馈不断 refinement 其操作策略。实验结果表明,ContextNav 在多个数据集上实现了最先进的性能,彰显了代理式工作流程在推动多模态 ICL 可扩展且鲁棒的情境化方面的潜力。
引用
@article{arxiv.2510.04560,
title = {ContextNav: Towards Agentic Multimodal In-Context Learning},
author = {Honghao Fu and Yuan Ouyang and Kai-Wei Chang and Yiwei Wang and Zi Huang and Yujun Cai},
journal= {arXiv preprint arXiv:2510.04560},
year = {2025}
}