中文

面向激光增材制造中基于机器学习的现场监控的音视频跨模态知识迁移

计算工程、金融与科学 2025-02-11 v4 机器学习

摘要

已开发出各种基于机器学习(ML)的现场监控系统,用于检测激光增材制造(LAM)过程中是否存在异常和缺陷。虽然多模态融合(即整合视觉、音频及其他模态数据)可提高监控性能,但也会增加硬件、计算和操作成本。本文引入了一种针对 LAM 现场监控的跨模态知识迁移(CMKT)方法,通过将知识从源模态迁移到目标模态来实现监控。CMKT 通过增强从目标模态中提取的特征的代表性,从而允许在预测阶段移除源模态传感器。本文提出了三种 CMKT 方法:语义对齐、全监督映射和半监督映射。语义对齐方法通过建立模态之间的共享编码空间来促进知识迁移。它采用语义对齐损失以对齐相同组(例如视觉和音频损坏组)的分布,并采用分离损失以区分不同组(例如视觉损坏和音频无损坏组)。两种映射方法通过全监督和半监督学习方法从一种模态推导特征到另一种模态。就 LAM 现场缺陷检测案例而言,本文将提出的 CMKT 方法与多模态音视频融合进行了比较。语义对齐方法在预测阶段移除音频模态后实现了 98.6% 的准确率,而通过多模态融合获得的准确率为 98.2%。使用可解释人工智能,我们发现语义对齐 CMKT 通过利用模态之间的内在相关性来提取更具代表性的特征并降低噪声。

关键词

引用

@article{arxiv.2408.05307,
  title  = {Audio-visual cross-modality knowledge transfer for machine learning-based in-situ monitoring in laser additive manufacturing},
  author = {Jiarui Xie and Mutahar Safdar and Lequn Chen and Seung Ki Moon and Yaoyao Fiona Zhao},
  journal= {arXiv preprint arXiv:2408.05307},
  year   = {2025}
}

备注

47 pages, 19 figures, 6 tables