中文

一种用于电商产品描述生成的多模态上下文调优方法

计算与语言 2024-03-08 v2 计算机视觉与模式识别

摘要

本文提出了一种新的设置,用于从图像生成产品描述,并辅以营销关键词。它利用视觉和文本信息的结合力量,创建更贴合产品独特特征的描述。针对此设置,以往的方法利用视觉和文本编码器对图像和关键词进行编码,并采用基于语言模型的解码器生成产品描述。然而,生成的描述往往不准确且泛化,因为同类产品的文案相似,且在大规模样本上优化整体框架会使模型集中于常用词而忽略产品特征。为缓解这一问题,我们提出了一种简单有效的多模态上下文调优方法,名为 ModICT,该方法引入相似产品样本作为参考,并利用语言模型的上下文学习能力来生成描述。在训练过程中,我们保持视觉编码器和语言模型冻结,专注于优化负责创建多模态上下文参考和动态提示的模块。这种方法保留了大型语言模型 (LLMs) 的语言生成能力,显著提高了描述的多样性。为了评估 ModICT 在不同规模和类型的语言模型上的有效性,我们从电商领域的三个不同产品类别中收集了数据。大量实验表明,与传统方法相比,ModICT 显著提高了生成结果的准确性(Rouge-L 最高提升 3.3%)和多样性(D-5 最高提升 9.4%)。我们的研究结果强调了 ModICT 作为增强各种应用中产品描述自动生成的有价值工具的潜力。代码地址:https://github.com/HITsz-TMG/Multimodal-In-Context-Tuning

关键词

引用

@article{arxiv.2402.13587,
  title  = {A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation},
  author = {Yunxin Li and Baotian Hu and Wenhan Luo and Lin Ma and Yuxin Ding and Min Zhang},
  journal= {arXiv preprint arXiv:2402.13587},
  year   = {2024}
}

备注

Accepted by LREC-COLING 2024