探索多模态视觉语言系统的融合策略
机器学习
2025-12-01 v1
摘要
现代机器学习模型经常组合多个输入数据流以更准确地捕获其决策所需的信息。在多模态机器学习中,选择数据融合的策略需要仔细考虑应用程序的准确性和延迟要求,因为在模型架构的不同阶段进行数据融合可能导致准确性和延迟的变化。在为此展示此权衡,我们使用混合 BERT 和视觉网络框架来集成图像和文本数据。我们探讨两种不同的视觉网络:MobileNetV2 和 ViT。我们为每个视觉网络提出了三个模型,这些模型在架构的晚期、中间和早期阶段进行数据融合。我们在 CMU MOSI 数据集上评估所提出的模型,并在 NVIDIA Jetson Orin AGX 上基准测试其延迟。我们的实验结果表明,虽然晚期融合产生最高的准确性,但早期融合提供最低的推理延迟。我们描述了这三个提议模型的架构,并讨论了准确性和延迟之间的权衡,得出结论:在模型架构中更早地进行数据融合会导致更快的推理时间,但以准确性为代价。
引用
@article{arxiv.2511.21889,
title = {Exploring Fusion Strategies for Multimodal Vision-Language Systems},
author = {Regan Willis and Jason Bakos},
journal= {arXiv preprint arXiv:2511.21889},
year = {2025}
}