面向电商的图像嵌入基准测试:评估即插即用基础模型、微调策略及实际权衡
计算机视觉与模式识别
2025-04-11 v1 人工智能
计算工程、金融与科学
信息检索
机器学习
摘要
我们对比评估了用于电商场景中图像嵌入的基础模型,包括分类和检索任务,评估其适用于实际应用的效果。本研究涵盖了通过监督学习、自监督学习和文本-图像对比学习训练的卷积模型和Transformer模型的嵌入。我们在六个多样化的电商数据集(时尚、消费品、汽车、食品和零售)上评估了完全微调和迁移学习(顶层微调)。结果显示,完全微调始终表现良好,而文本-图像和自监督嵌入可通过降低训练成本与其性能相当。虽然监督嵌入在不同架构间保持稳定,但SSL和对比嵌入差异较大,通常受益于顶层微调。顶层微调作为完全微调的高效替代方案,可显著降低计算成本。我们还探讨了交叉微调(cross-tuning),发现其影响取决于数据集特征。我们的发现为嵌入选择和微调策略提供了实用指南,在效率与性能之间进行权衡。
引用
@article{arxiv.2504.07567,
title = {Benchmarking Image Embeddings for E-Commerce: Evaluating Off-the Shelf Foundation Models, Fine-Tuning Strategies and Practical Trade-offs},
author = {Urszula Czerwinska and Cenk Bircanoglu and Jeremy Chamoux},
journal= {arXiv preprint arXiv:2504.07567},
year = {2025}
}
备注
accepted at Future Technologies Conference (FTC 2025)