中文

ENC-Bench:面向电子航图理解的人工智能多模态大语言模型评估基准

计算机视觉与模式识别 2026-03-25 v1

摘要

电子航图(ENC)是现代海上导航的安全核心,然而目前尚不清楚多模态大语言模型(MLLM)能否可靠地解读它们。与自然图像或常规图表不同,ENC通过标准化矢量符号、比例相关渲染以及精确几何结构编码了航行法规、水深信息及路径约束——这要求具备专业航海知识才能进行解读。我们引入ENC-Bench,首个专注专业ENC理解的数据基准。ENC-Bench包含20,490个经专家验证的样本,来自840套真实的国家海洋大气管理局(NOAA)ENC,采用三层层次结构组织:感知层(符号与特征识别)、空间推理层(坐标定位、方位、距离)以及航海决策层(路径合法性、安全评估、在多重约束下的紧急规划)。所有样本经从原始S-57数据经校准的矢量转图像管道生成,包含自动一致性检查与专家审核。我们在统一的零样本协议下评估了10个最新MLLM,如GPT-4o、Gemini 2.5、Qwen3-VL、InternVL-3和GLM-4.5V。最佳模型仅达到47.88%准确率,系统性挑战包括符号 grounding、空间计算、多约束推理以及对光照和比例变化的鲁棒性。通过建立首个严谨的ENC基准,我们开启了专门符号推理与安全关键AI交叉的新研究前沿,为推动MLLM向专业航海应用提供essential infrastructure。

关键词

引用

@article{arxiv.2603.22763,
  title  = {ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding},
  author = {Ao Cheng and Xingming Li and Xuanyu Ji and Xixiang He and Qiyao Sun and Chunping Qiu and Runke Huang and Qingyong Hu},
  journal= {arXiv preprint arXiv:2603.22763},
  year   = {2026}
}

备注

Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/