基于 LLM 的视觉增强风格提取与角色导向服装生成
信息检索
2024-02-14 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
服装生成问题涉及根据用户的兴趣向其推荐一套完整的服装。现有方法侧重于基于锚点物品或特定查询风格推荐物品,但未考虑顾客对电影、社交媒体等中知名角色的兴趣。在本文中,我们定义了一个新的基于角色的服装生成(COG)问题,旨在准确解读角色信息,并根据年龄和性别等顾客规格生成完整的服装套装。为解决这一问题,我们提出了一种新框架 LVA-COG,该框架利用大型语言模型(LLMs)从顾客兴趣(例如,角色信息)中提取见解,并采用提示工程技术以准确理解顾客偏好。此外,我们结合了文本到图像模型,以增强具有凝聚力的服装的视觉理解和生成(事实性或反事实性)。我们的框架将 LLMs 与文本到图像模型相结合,通过生成个性化推荐来改善顾客的时尚选择。通过实验和案例研究,我们从多个维度证明了我们解决方案的有效性。
引用
@article{arxiv.2402.05941,
title = {Character-based Outfit Generation with Vision-augmented Style Extraction via LLMs},
author = {Najmeh Forouzandehmehr and Yijie Cao and Nikhil Thakurdesai and Ramin Giahi and Luyi Ma and Nima Farrokhsiar and Jianpeng Xu and Evren Korpeoglu and Kannan Achan},
journal= {arXiv preprint arXiv:2402.05941},
year = {2024}
}
备注
7 pages, 4 figures, IEEE Big Data 2023 3rd Workshop on Multimodal AI (MMAI 2023), IEEE BigData 2023