Orion:一种统一的多模态感知、高级视觉推理与执行视觉智能体
计算机视觉与模式识别
2025-11-21 v2 人工智能
机器学习
摘要
我们提出 Orion,一种集成基于视觉的推理与工具增强执行的视觉智能体,实现跨图像、视频和文档的强大、精确的多步骤视觉智能。不同于传统视觉语言模型仅生成描述性输出的模型,Orion 调度一套专门的计算机视觉工具,包括目标检测、关键点定位、全景分割、光学字符识别(OCR)和几何分析,以执行复杂的多步骤视觉工作流程。该系统在 MMMU、MMBench、DocVQA 和 MMLongBench 等基准上实现了具竞争力的性能,扩展了单一 VLM 的能力,使其达到生产级视觉智能水平。通过其智能体化、工具增强的方法,Orion 实现了从神经感知到符号执行的自主视觉推理,标志着从被动视觉理解向主动、工具驱动的视觉智能的转变。欢迎免费尝试 Orion:https://chat.vlm.run 了解更多信息:https://www.vlm.run/orion
引用
@article{arxiv.2511.14210,
title = {Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution},
author = {N Dinesh Reddy and Dylan Snyder and Lona Kiragu and Mirajul Mohin and Shahrear Bin Amin and Sudeep Pillai},
journal= {arXiv preprint arXiv:2511.14210},
year = {2025}
}