ORCA: 一种面向视觉-语言模型幻觉与对抗鲁棒性的智能体推理框架
计算机视觉与模式识别
2026-05-20 v3 人工智能
多智能体系统
摘要
大型视觉-语言模型(LVLMs)展现出强大的多模态能力,但仍然容易受到内在错误导致的幻觉和外部利用导致的对抗攻击的影响,这限制了它们在实际应用中的可靠性。我们提出ORCA,一个智能体推理框架,通过推理时的结构化推理,结合一系列小型视觉模型(少于3B参数),提升预训练LVLMs的事实准确性和对抗鲁棒性。ORCA通过观察-推理-批评-行动循环运作,向多个视觉工具查询证据性问题,验证跨模型不一致性,并在不访问模型内部或无需重新训练的情况下迭代优化预测。ORCA还存储中间推理轨迹,支持可审计的决策制定。虽然主要设计用于缓解目标级幻觉,但ORCA也展现出涌现的对抗鲁棒性,无需对抗训练或防御机制。我们在三种设置下评估ORCA:(1)干净图像上的幻觉基准测试,(2)无防御的对抗扰动图像,(3)施加防御的对抗扰动图像。在POPE幻觉基准上,ORCA将独立LVLMs的性能提升了+3.64%至+40.67%(在不同子集上)。在POPE上的对抗扰动下,ORCA在LVLMs上实现了平均+20.11%的准确率提升。当与防御技术结合应用于对抗扰动的AMBER图像时,ORCA进一步提升了独立LVLM的性能,各指标增益范围为+1.20%至+48.00%。这些结果表明ORCA为构建更可靠和鲁棒的多模态系统提供了有前景的路径。
引用
@article{arxiv.2509.15435,
title = {ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models},
author = {Chung-En Johnny Yu and Brian Jalaian and Nathaniel D. Bastian},
journal= {arXiv preprint arXiv:2509.15435},
year = {2026}
}
备注
Accepted at the ACM International Conference on Cloud and Big Data Computing (ICCBDC 2026)