Logics-Parsing-Omni 技术报告
人工智能
2026-04-09 v3
摘要
针对多模态解析中任务定义碎片化和非结构化数据异构性的挑战, 本文提出了 Omni Parsing 框架. 该框架建立了覆盖文档、图像和音视频流的统一分类体系, 引入渐进式解析范式, 构建感知与认知之间的桥梁. 具体而言, 框架集成了三个层次: 1) 整体检测, 通过精准的时空定位实现对象或事件的几何基准感知; 2) 细粒度识别, 对局部对象执行符号化(如OCR/ASR)和属性提取, 完成结构化实体解析; 3) 多层次解释, 从局部语义构建推理链至全局逻辑. 本框架的关键优势在于证据锚定机制, 强制高层语义描述与底层事实的严格对齐. 这实现了基于证据的逻辑归纳, 将非结构化信号转化为可定位、可枚举、可追溯的标准化知识. 在此基础上, 我们构建了标准化数据集并发布了 Logics-Parsing-Omni 模型, 成功将复杂音视频信号转换为机器可读结构化知识. 实验表明, 细粒度感知与高层认知是协同的, 有效提升了模型可靠性. 此外, 为量化评估这些能力, 我们引入 OmniParsingBench. 代码、模型和基准已发布于 https://github.com/alibaba/Logics-Parsing/tree/master/Logics-Parsing-Omni.
引用
@article{arxiv.2603.09677,
title = {Logics-Parsing-Omni Technical Report},
author = {Xin An and Jingyi Cai and Xiangyang Chen and Huayao Liu and Peiting Liu and Peng Wang and Bei Yang and Xiuwen Zhu and Yongfan Chen and Yan Gao and Yuan Gao and Baoyu Hou and Guangzheng Hu and Shuzhao Li and Weixu Qiao and Weidong Ren and Yanan Wang and Boyu Yang and Fan Yang and Jiangtao Zhang and Lixin Zhang and Lin Qu and Hu Wei and Xiaoxiao Xu and Bing Zhao},
journal= {arXiv preprint arXiv:2603.09677},
year = {2026}
}