中文

DART:用于综合绳索状态监控的视觉语言基础模型

计算机视觉与模式识别 2026-05-07 v1 人工智能

摘要

合成纤维绳索(SFRs)在海上、海事和工业环境中的状态监控(CM)的需求远不止于分类:检查员需要连续的严重程度估计、维护建议、异常标记、退化时间表以及来自单张检查图像的自动化报告。我们提出了DART(Damage Assessment via Rope Transformer),一种视觉语言基础模型,通过统一的多任务架构解决整个绳索检查工作流程。DART通过将视觉Transformer(ViT-H/14)与Llama-3.2-3B-Instruct通过严重程度条件化跨模态融合(SC-CMF)模块耦合,将联合嵌入预测架构(JEPA)扩展到跨模态领域。三个架构创新驱动了模型的 versatility:(1)HD-MASK,一种以显著性引导的掩码策略,聚焦于损伤密集区域的自监督重建;(2)每个类别可学习的严重程度门,适应性地加权损伤类别的语言校准;(3)对比损伤解�合(CDD)损失,塑造嵌入空间以同时编码损伤类型、严重程度排序以及跨模态语义。在使用4270张覆盖14种细粒度绳索损伤类的图像进行训练后,冻结的DART主干网络支持无需任何任务特定微调的下游任务:损伤分类(准确率93.22%,宏F1 91.04%,比仅视觉基线提高38.5个百分点),连续严重程度回归(Spearman rho = 0.94,within-1-ordinal准确率99.6%),少样本识别(20 shots下宏F1 89.2%)。这些结果表明DART作为通用CM主干网络,能够从单一共享表示中提供可操作的检查智能,远超分类功能。

关键词

引用

@article{arxiv.2605.04943,
  title  = {DART: A Vision-Language Foundation Model for Comprehensive Rope Condition Monitoring},
  author = {Anju Rani and Daniel Ortiz-Arroyo and Petar Durdevic},
  journal= {arXiv preprint arXiv:2605.04943},
  year   = {2026}
}

备注

18 pages, 8 figures, 9 tables