VOGUE:面向时尚对话推荐的多模态数据集
信息检索
2026-05-29 v2
摘要
多模态对话推荐最近作为一种通过富含视觉和语境 grounding 的自然对话交付个性化体验的新兴范式,备受关注。然而目前可用的多模态对话推荐数据集仍有限:现有资源要么模拟对话,要么缺少用户历史,要么未收集足够细致的反馈,这限制了其支持的研究类型和评估方式。为弥补这些差距,我们引入了 VOGUE 数据集,包含 60 组人类对话,涵盖 2100 条在真实时尚购物场景中被细粒度标记的 utterance。每段对话配有共享的视觉目录、物品元数据、用户时尚轮廓以及来自用户(Seeker)和推荐员(Assistant)的对话后评级。该设计支持对对话推断的严格评估,包括预测偏好与真实偏好的一致性、针对完整评级分布的校准,以及与显式和隐式用户满意度信号的比较。我们对 VOGUE 的分析揭示了视觉 grounding 对话的独特动态,例如推荐员经常以基于特征的群组方式同时推荐物品,这创建了由 Seeker 批评和细化所桥接的 distinct 对话阶段。对比人类推荐员表明,虽然多模态大语言模型(MLLM)在整体上接近人类水平的对齐度,但在再现人类评级时表现出系统性分布错误,且难以在讨论之外的偏好推断上取得成功。这些发现将 VOGUE 确立为研究多模态对话系统的独特资源,也是一个超越当前顶尖多模态基础模型(如 GPT-5-mini 和 Gemini-2.5-Flash)能力的数据集挑战。
引用
@article{arxiv.2510.21151,
title = {VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion},
author = {David Guo and Minqi Sun and Yilun Jiang and Jiazhou Liang and Scott Sanner},
journal= {arXiv preprint arXiv:2510.21151},
year = {2026}
}