中文

多模态大语言模型是否理解焊接?

计算与语言 2025-03-24 v1 计算机视觉与模式识别

摘要

本文检验了多模态大语言模型(Multimodal Large Language Model,MLLM)在熟练生产作业中的性能,聚焦焊接领域。我们使用一套新构建的真实世界和线上焊接图像数据集,由领域专家标注,评估两种最新 MLLM 在三个情境下(RV & Marine、Aeronautical 和 Farming)焊接可接受性的判断。尽管两种模型在线上图像上的表现更好,可能是由于事先暴露或记忆,但它们也在未见的真实世界焊接图像上表现相当出色。此外,我们引入了 WeldPrompt,一种将链式思维生成与情境学习结合的提示策略,用于缓解幻觉并提高推理。WeldPrompt 在某些情境中提高了模型的召回率,但在其他情境中表现不一致。这些结果凸显了 MLLM 在高风险技术领域的局限性和潜力,突显了微调、领域特定数据以及更复杂提示策略对提高模型可靠性的重要性。该研究为多模态学习在工业应用中的进一步研究开辟了道路。

关键词

引用

@article{arxiv.2503.16537,
  title  = {Do Multimodal Large Language Models Understand Welding?},
  author = {Grigorii Khvatskii and Yong Suk Lee and Corey Angst and Maria Gibbs and Robert Landers and Nitesh V. Chawla},
  journal= {arXiv preprint arXiv:2503.16537},
  year   = {2025}
}

备注

16 pages