中文

解码风格:面向图像引导的时尚推荐的 LLM 高效微调

信息检索 2024-09-19 v1 人工智能 机器学习

摘要

个性化时尚推荐仍是复杂挑战,要求兼顾时尚搭配理解和趋势感知。本文提出一种新框架,利用大语言模型(LLM)的表达能力解决此问题,通过微调和直接反馈集成缓解其“黑箱”和静态性。我们通过采用多模态大语言模型(MLLM)的图像字幕技术,桥接物品描述中的视觉-文本鸿沟,使 LLM 能够从人类精选的时尚图像中提取风格和颜色特征,为个性化推荐奠定基础。LLM 在开源的 Polyvore 时尚图像数据集上进行高效微调,优化其推荐时尚搭配的能力。采用负例的直接偏好机制,以增强 LLM 的决策过程,形成一个自我完善的人工智能反馈回路,不断根据季节时尚趋势细化推荐。我们的框架在 Polyvore 数据集上进行评估,证明其在两个关键任务中的有效性:填空和complementary 物品检索。这些评估凸显了框架生成时尚、符合趋势的搭配建议的能力,持续通过直接反馈不断改进。评估结果表明,我们的框架显著优于基线 LLM,创建更连贯的搭配。这些改进结果彰显了我们框架在提升购物体验、提供准确建议方面的潜力,证明其相对于基于 vanilla LLM 的 outfit 生成效果更佳。

关键词

引用

@article{arxiv.2409.12150,
  title  = {Decoding Style: Efficient Fine-Tuning of LLMs for Image-Guided Outfit Recommendation with Preference},
  author = {Najmeh Forouzandehmehr and Nima Farrokhsiar and Ramin Giahi and Evren Korpeoglu and Kannan Achan},
  journal= {arXiv preprint arXiv:2409.12150},
  year   = {2024}
}

备注

CIKM 2024