通过定量与定性指标评估自我纠错视觉智能体
计算机视觉与模式识别
2026-01-21 v1
摘要
多模态基础模型的最新进展使得视觉语言智能体能够将复杂的视觉任务分解为可执行的基于工具的计划。尽管最近的基准测试已开始评估迭代式自我纠错,但其定量极限与主要推理瓶颈仍缺乏充分刻画。本工作引入了一个诊断性微型基准测试。我们的分析将任务成功率(TSR = 62 percent)与纠错成功率(CSR = 25 to 33 percent)解耦,揭示了初始能力并不能预测修复能力。我们明确量化了纠错的边际收益递减效应,该效应在三次重试后达到饱和。我们的失败分类法揭示了一个常见因素——语义漂移(约 28 percent 的失败),即上下文状态的丢失。通过隔离这一推理瓶颈,该基准测试为构建有状态、可信赖的多模态智能体定义了一个可复现的框架。
引用
@article{arxiv.2601.11637,
title = {Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics},
author = {Aradhya Dixit},
journal= {arXiv preprint arXiv:2601.11637},
year = {2026}
}