中文

LaViC: 适用于视觉感知对话推荐的大型视觉语言模型

人工智能 2025-04-01 v1 计算机视觉与模式识别

摘要

对话式推荐系统通过对话与用户交互以细化其需求并提供更个性化的建议。虽然文本信息对许多领域足够,但在时尚或家居装饰等视觉驱动类别中,可能需要与颜色、造型或设计相关的详细视觉信息。为解决这一挑战,我们提出LaViC(Large Vision-Language Conversational Recommendation Framework,即大型视觉语言对话推荐框架),一种一种将紧凑图像表示整合到基于对话的推荐系统中的新方法。LaViC利用大型视觉语言模型采用两阶段过程:(1)视觉知识自蒸馊,这会将来自数百个标记的产品图像浓缩为少量视觉标记的自蒸馊方式,显著减少计算开销,和(2)推荐提示调优,这使模型能够整合对话背景和蒸馏后的视觉标记,为捕捉文本和视觉特征提供统一机制。为支持视觉感知对话推荐的严格评估,我们通过将 Reddit 对话与多个视觉导向类别(例如时尚、美妆和家居)的亚马逊产品列表对齐构建了新数据集。该数据集涵盖了视觉细节至关重要的领域中真实用户查询和产品外观。广泛的实验表明,LaViC显著优于文本-only对话推荐方法和开源视觉语言基线。此外,LaViC在准确度上与突出的专有基线(例如GPT-3.5-turbo、GPT-4o-mini和GPT-4o)相竞争或更好,表明在捕捉产品属性方面明确使用视觉数据是必要的,并且我们的视觉语言集成效果显著。我们的代码和数据集可在 https://github.com/jeon185/LaViC 提供。

关键词

引用

@article{arxiv.2503.23312,
  title  = {LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation},
  author = {Hyunsik Jeon and Satoshi Koide and Yu Wang and Zhankui He and Julian McAuley},
  journal= {arXiv preprint arXiv:2503.23312},
  year   = {2025}
}