EffiMiniVLM: 一种紧凑型双编码器回归框架
计算机视觉与模式识别
2026-04-06 v1
摘要
从多模态商品信息预测产品质量在冷启动场景中至关重要,此时用户交互历史不可用,预测必须依赖图像和文本元数据。然而,现有的视觉语言模型通常依赖大型架构和/或大量外部数据集,导致高计算成本。为此,我们提出了 EffiMiniVLM,一个紧凑型双编码器视觉语言回归框架,集成了 EfficientNet-B0 图像编码器和基于 MiniLM 的文本编码器以及轻量回归头。为提高训练样本效率,我们引入了一种利用评分数量来强调更可靠样本的加权 Huber 损失,从而获得一致的性能提升。仅使用 Amazon Reviews 2023 数据集的 20% 进行训练,所提出的模型包含 27.7M 参数,需要 6.8 GFLOPs,但在基准测试中实现了 CES 分数 0.40,且资源成本最低。尽管规模较小,它仍与显著更大的模型保持竞争力,以大约 4 至 8 倍的资源效率实现了可比性能,并且是唯一不使用外部数据集的方法。进一步分析表明,仅将数据规模扩大到 40% 就足以使我们的模型超越使用更大模型和数据集的其他方法,凸显了尽管模型设计紧凑但具有很强的可扩展性。
引用
@article{arxiv.2604.03172,
title = {EffiMiniVLM: A Compact Dual-Encoder Regression Framework},
author = {Yin-Loon Khor and Yi-Jie Wong and Yan Chai Hum},
journal= {arXiv preprint arXiv:2604.03172},
year = {2026}
}