中文

MOON:基于生成式多模态大语言模型的电商产品理解

计算机视觉与模式识别 2026-03-03 v5 人工智能 信息检索 机器学习

摘要

随着电商的快速发展,探索通用表征而非特定于任务的表征正受到越来越多的研究关注。对于产品理解,尽管现有的判别式双流体系结构在该领域推动了进展,但它们本质上难以建模产品多个图像和文本之间的许多对一 alignments。因此,我们认为生成式多模态大语言模型(MLLM)在改进产品表征学习方面具有重要潜力。然而,实现这一目标仍存在若干关键挑战:典型LLM中缺乏多模态和方面感知建模模块;产品图像中常见背景噪声;以及缺乏用于评估的标准基准。为此,我们提出首个基于生成式MLLM的模型,命名为MOON,用于产品表征学习。我们的方法(1)采用引导式混合专家(MoE)模块针对性地建模多模态和方面特定的产品内容;(2)有效检测产品图像中的核心语义区域,以减轻背景噪声的干扰和干扰;(3)引入专门的负采样策略以增加负样本的难度和多样性。此外,我们发布了一个大规模多模态基准MBE,用于各种产品理解任务。实验结果表明,我们的模型在我们的基准和公开数据集上都表现出竞争力的零样本性能,展示了在各种下游任务(包括跨模态检索、产品分类和属性预测)中的强大泛化能力。此外,案例研究和可视化结果说明了MOON在产品理解方面的有效性。我们MBE基准的数据可在https://huggingface.co/datasets/Daoze/MM-Bench-E-Commerce获取。

关键词

引用

@article{arxiv.2508.11999,
  title  = {MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding},
  author = {Daoze Zhang and Chenghan Fu and Zhanheng Nie and Jianyu Liu and Wanxian Guan and Yuan Gao and Jun Song and Pengjie Wang and Jian Xu and Bo Zheng},
  journal= {arXiv preprint arXiv:2508.11999},
  year   = {2026}
}

备注

Accepted by WSDM 2026 (oral). 11 pages, 9 figures