中文

超越最终答案:CRYSTAL基准用于透明多模态推理评估

人工智能 2026-03-17 v2 计算机视觉与模式识别 信息检索 多媒体

摘要

我们引入CRYSTAL(Clear Reasoning via Yielded Steps, Traceability, and Logic),一个包含6,372个实例的诊断性基准,用于通过可验证的中间步骤评估多模态推理。我们提出两种互补指标:Match F1通过语义相似性匹配对步骤级别的精确率和召回率进行评分,Ordered Match F1进一步对乱序推理链进行惩罚。参考文献通过Delphi式管道构建:四个独立的MLLMs生成轨迹,然后通过语义聚类进行聚合,并通过人类质量关口进行验证。对20个MLLMs(包括在基准构建期间未使用的商业前沿系统)的评估揭示了那些在答案准确率下不可见的系统性失效:普遍的cherry-picking(精确率远高于召回率)、非单调扩展权衡,以及没有竞争模型能在正确顺序中保留超过60%匹配步骤的乱序推理。除评估外,我们提出了因果过程奖励(Causal Process Reward, CPR),一种将答案正确性与步骤级别对齐度耦合的乘法性奖励,以及CPR-Curriculum,通过在训练期逐步增加推理难度。CPR-Curriculum通过GRPO实现32%的Match F1提升,添加性奖励策略失败,提升推理能力而无需手动步骤标注。

关键词

引用

@article{arxiv.2603.13099,
  title  = {Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation},
  author = {Wayner Barrios and SouYoung Jin},
  journal= {arXiv preprint arXiv:2603.13099},
  year   = {2026}
}