中文

EIVEN:基于多模态大语言模型的高效隐式属性值提取

计算机视觉与模式识别 2024-04-16 v1 人工智能 计算与语言 信息检索 机器学习

摘要

在电子商务中,从多模态数据中准确提取产品属性值对于提升用户体验和零售商运营效率至关重要。然而,以往的多模态属性值提取方法往往难以处理嵌入在图像或文本中的隐式属性值,严重依赖大量标注数据,且容易混淆相似的属性值。为解决这些问题,我们提出了EIVEN,一个数据与参数高效的生成式框架,率先将多模态大语言模型用于隐式属性值提取。EIVEN利用预训练大语言模型和视觉编码器丰富的内在知识,减少了对标注数据的依赖。我们还引入了一种新颖的“比较学习”技术,通过强制进行属性值比较和差异识别来减少模型混淆。此外,我们构建了首个用于多模态隐式属性值提取的开源数据集。大量实验表明,EIVEN在提取隐式属性值方面显著优于现有方法,同时所需的标注数据更少。

关键词

引用

@article{arxiv.2404.08886,
  title  = {EIVEN: Efficient Implicit Attribute Value Extraction using Multimodal LLM},
  author = {Henry Peng Zou and Gavin Heqing Yu and Ziwei Fan and Dan Bu and Han Liu and Peng Dai and Dongmei Jia and Cornelia Caragea},
  journal= {arXiv preprint arXiv:2404.08886},
  year   = {2024}
}

备注

Accepted by NAACL 2024 Industry Track