利用图像、文本与参数数据进行车辆评分预测的多模态机器学习
机器学习
2024-01-05 v2 人工智能
计算机视觉与模式识别
摘要
准确的车辆评分预测有助于设计和配置优良车辆。该预测使车辆设计者与制造商能及时优化改进设计、提升产品性能并有效吸引消费者。然而,现有大多数数据驱动方法依赖单一模态数据,如文本、图像或参数数据,导致对可用信息的有限且不完整探索。这些方法缺乏对多模态数据的综合分析探索,可能导致不准确结论并阻碍领域进展。为克服此局限,我们提出一个多模态学习模型以进行更全面准确的车辆评分预测。具体而言,该模型同时学习车辆参数规格、文本描述与图像特征,预测五项车辆评分,包括总分、评论者分、性能分、安全分与内饰分。我们将多模态学习模型与相应单模态模型比较,发现多模态模型解释力比单模态模型高 4%–12%。在此基础上,我们使用 SHAP 进行敏感性分析以解释模型,并为设计者与制造商提供设计与优化方向。我们的研究强调了数据驱动多模态学习方法对车辆设计、评估与优化的重要性。我们已将代码公开于 http://decode.mit.edu/projects/vehicleratings/。
引用
@article{arxiv.2305.15218,
title = {Multi-modal Machine Learning for Vehicle Rating Predictions Using Image, Text, and Parametric Data},
author = {Hanqi Su and Binyang Song and Faez Ahmed},
journal= {arXiv preprint arXiv:2305.15218},
year = {2024}
}
备注
The paper submitted to IDETC/CIE2023, the International Design Engineering Technical Conferences & Computers and Information in Engineering Conference, has been accepted