中文

FusWay:多模态混合融合方法及其在铁路缺陷检测中的应用

计算机视觉与模式识别 2025-09-10 v1 人工智能

摘要

多模态融合是一种多媒体技术,在图像信息伴随信号/音频的广泛任务中变得流行。后者可能不携带高度语义化的信息(如语音或音乐),而是一些度量,例如由麦克风记录的旨在检测铁路结构元素或缺陷的音频信号。虽然 You Only Look Once (YOLO) 系列检测器等经典检测方法可以有效地部署用于图像模态上的缺陷检测,但单一模态方法仍然存在局限性。在出现与正常结构元素相似的外观时,它们会导致过度检测。本文提出了一种基于领域规则构建的新型多模态融合架构,结合了 YOLO 和 Vision Transformer 主干网络。它集成了用于快速目标检测的 YOLOv8n 与 Vision Transformer (ViT),以融合从多层(7、16 和 19)提取的特征图,并为两类缺陷(钢轨断裂和表面缺陷)合成音频表示。融合在音频与图像之间进行。在真实世界铁路数据集上的实验评估表明,与仅视觉方法相比,我们的多模态融合将精确度和整体准确率提高了 0.2 个百分点。Student 非配对 t 检验也证实了平均准确率差异的统计显著性。

关键词

引用

@article{arxiv.2509.06987,
  title  = {FusWay: Multimodal hybrid fusion approach. Application to Railway Defect Detection},
  author = {Alexey Zhukov and Jenny Benois-Pineau and Amira Youssef and Akka Zemmari and Mohamed Mosbah and Virginie Taillandier},
  journal= {arXiv preprint arXiv:2509.06987},
  year   = {2025}
}