中文

DataCross: 跨模态异构数据分析的统一基准与智能体框架

人工智能 2026-01-30 v1 多智能体系统

摘要

在现实世界的数据科学和企业决策中,关键信息常常分散在可直接查询的结构化数据源(如 SQL、CSV)和分散在非结构化视觉文档中的"僵尸数据"(如扫描报告、发票图像)之中。现有的智能体主要局限于处理结构化数据,无法激活和关联这些高价值的视觉信息,从而与工业需求存在显著差距。为填补这一差距,我们引入 DataCross,一个用于跨异构数据模态的统一、洞察驱动分析的基准和协作智能体框架。DataCrossBench 包含 200 个端到端分析任务,覆盖金融、医疗保健等多个领域。它通过人类参与的逆合成管道构建,确保现实的复杂性、跨源依赖和可验证的真实答案。基准将任务分为三个难度层级,以评估智能体在视觉表格提取、跨模态对齐和多步骤联合推理方面的能力。我们还提出 DataCrossAgent 框架,受人类分析师"分而治之"工作流程的启发。它采用专门的子智能体,每个智能体都是特定数据源的专家,这些智能体通过 Intra-source Deep Exploration(源内深度探索)、Key Source Identification(关键源识别)和 Contextual Cross-pollination(情境轮询)的结构化工作流程进行协调。一种新的 reReAct 机制使其能够 robustly 生成和调试代码以进行事实验证。实验结果表明,DataCrossAgent 在事实正确性方面比 GPT-4o 提高了 29.7%,在高难度任务上表现出色,有效地激活了分散的"僵尸数据"以进行跨模态分析。

关键词

引用

@article{arxiv.2601.21403,
  title  = {DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis},
  author = {Ruyi Qi and Zhou Liu and Wentao Zhang},
  journal= {arXiv preprint arXiv:2601.21403},
  year   = {2026}
}