基于紧凑多模态模型的产品属性高效学习
计算机视觉与模式识别
2025-07-29 v1 人工智能
摘要
图像基产品属性预测是电商中的关键任务,具有众多应用场景。受限于手动或API-based标注成本,基于监督式微调的视觉语言模型(VLM)面临显著的规模挑战。本文我们探索了针对紧凑型VLM(2B-3B参数)的标签高效半监督微调策略,这些策略通过Direct Preference Optimization(DPO)利用未标记的产品列表。我们首先从小规模的API-based标注数据集开始,采用PEFT训练低秩适配器模块。为利用未标记数据更新适配器权重,我们为每个未标记样本生成多个推理-答案链,并根据自一致性将这些链 segregate为首选和次选。随后我们使用DPO损失对模型进行微调,并使用更新后的模型进行下一轮迭代。通过PEFT微调结合DPO,我们的方法在计算开销最小化的情况下实现了高效收敛。在覆盖十二个电商细分领域的数据集上,仅利用未标记数据进行的DPO-based微调相较于监督式模型显著优于后者。此外,实验表明,DPO训练的准确率随未标记数据的增加而提高,表明大规模未标记样本可以有效被利用以提升性能。
引用
@article{arxiv.2507.19679,
title = {Efficient Learning for Product Attributes with Compact Multimodal Models},
author = {Mandar Kulkarni},
journal= {arXiv preprint arXiv:2507.19679},
year = {2025}
}