中文

MIND:面向电商购买理解的大视觉语言模型多模态购物意图蒸馏

计算与语言 2024-10-15 v3

摘要

提升用户体验和在电商平台提供个性化搜索结果在很大程度上依赖于对购买意图的理解。然而,现有获取大规模意图的方法依赖于通过人工标注验证来蒸馏大语言模型。这种方法倾向于生成以产品为中心的意图,忽略了产品图像中宝贵的视觉信息,并且为扩展规模带来了高昂的成本。为了解决这些问题,我们引入了MIND,一个多模态框架,它允许大视觉语言模型从多模态产品元数据中推断购买意图,并优先考虑以人为中心的意图。利用亚马逊评论数据,我们应用MIND并创建了一个多模态意图知识库,其中包含从107,215个产品的126,142条共同购买购物记录中推导出的1,264,441个意图。广泛的人工评估证明了我们获得的意图具有高度的合理性和典型性,并验证了我们的蒸馏框架和过滤机制的有效性。额外的实验表明,我们获得的意图在两个意图理解任务中显著增强了大语言模型的能力。

关键词

引用

@article{arxiv.2406.10701,
  title  = {MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase Understanding},
  author = {Baixuan Xu and Weiqi Wang and Haochen Shi and Wenxuan Ding and Huihao Jing and Tianqing Fang and Jiaxin Bai and Xin Liu and Changlong Yu and Zheng Li and Chen Luo and Qingyu Yin and Bing Yin and Long Chen and Yangqiu Song},
  journal= {arXiv preprint arXiv:2406.10701},
  year   = {2024}
}

备注

EMNLP 2024 main conference