Med-CRAFT:基于知识图遍历自动构建可解释的多跳视频工作负载
人工智能
2025-12-02 v1
摘要
高质量、逻辑标注视频数据集的稀缺性仍是推动多模态大语言模型(MLLMs)在医学领域发展的主要瓶颈。传统的手动标注昂贵且不可扩展,而现有的合成方法常常 suffer from 随机幻觉且缺乏逻辑可解释性。为此,我们引入 \textbf{\PipelineName},一种新型神经符号数据工程框架,将基准合成形式化为确定性图遍历过程。与黑箱生成方法不同,Med-CRAFT 从原始视频流中提取结构化视觉原语(如外科器械、解剖边界),并将其实例化为动态时空知识图。通过将查询生成锚定在该图中的有效路径上,我们强制为每个合成基准项目建立严格的链式思维(Chain-of-Thought, CoT)源venance。我们实例化了该管道以产生 M3-Med-Auto,一个大规模医学视频推理基准,展现细粒度时序选择性和多跳逻辑复杂性。全面评估表明,我们的自动化管道生成的查询工作负载的复杂性与专家精选数据集相当。此外,逻辑对齐分析揭示,预设的图拓扑与最先进 MLLMs 的推理步骤之间存在高度相关性,验证了该系统能够将可验证的逻辑编码到视觉-语言基准测试中的能力。这一工作为在关键领域构建可扩展、低成本的鲁棒评估协议铺平了道路。
引用
@article{arxiv.2512.01045,
title = {Med-CRAFT: Automated Construction of Interpretable and Multi-Hop Video Workloads via Knowledge Graph Traversal},
author = {Shenxi Liu and Kan Li and Mingyang Zhao and Yuhang Tian and Shoujun Zhou and Bin Li},
journal= {arXiv preprint arXiv:2512.01045},
year = {2025}
}
备注
8 pages, 7 figures