中文

EffiMiniVLM: 一种紧凑型双编码器回归框架

计算机视觉与模式识别 2026-04-06 v1

摘要

从多模态商品信息预测产品质量在冷启动场景中至关重要,此时用户交互历史不可用,预测必须依赖图像和文本元数据。然而,现有的视觉语言模型通常依赖大型架构和/或大量外部数据集,导致高计算成本。为此,我们提出了 EffiMiniVLM,一个紧凑型双编码器视觉语言回归框架,集成了 EfficientNet-B0 图像编码器和基于 MiniLM 的文本编码器以及轻量回归头。为提高训练样本效率,我们引入了一种利用评分数量来强调更可靠样本的加权 Huber 损失,从而获得一致的性能提升。仅使用 Amazon Reviews 2023 数据集的 20% 进行训练,所提出的模型包含 27.7M 参数,需要 6.8 GFLOPs,但在基准测试中实现了 CES 分数 0.40,且资源成本最低。尽管规模较小,它仍与显著更大的模型保持竞争力,以大约 4 至 8 倍的资源效率实现了可比性能,并且是唯一不使用外部数据集的方法。进一步分析表明,仅将数据规模扩大到 40% 就足以使我们的模型超越使用更大模型和数据集的其他方法,凸显了尽管模型设计紧凑但具有很强的可扩展性。

关键词

引用

@article{arxiv.2604.03172,
  title  = {EffiMiniVLM: A Compact Dual-Encoder Regression Framework},
  author = {Yin-Loon Khor and Yi-Jie Wong and Yan Chai Hum},
  journal= {arXiv preprint arXiv:2604.03172},
  year   = {2026}
}