多模态对话推荐中生成式检索的测试时序缩放策略
信息检索
2025-08-26 v1 人工智能
机器学习
摘要
电子商务的快速发展暴露了传统产品检索系统在处理复杂多轮用户交互方面的局限性。最近出现的多模态生成式检索——尤其是利用多模态大语言模型(MLLM)作为检索器的技术——显示出了前景。然而,大多数现有方法针对单轮场景设计,难以在直接应用于对话场景时建模用户意图的演变和迭代性。同时,测试时序缩放已成为通过推理时迭代细化提升大语言模型(LLM)性能的强大范式。然而,其有效性通常依赖于两个条件:(1)明确的問題空间(如数学推理),以及(2)模型自我纠错能力——这在对话式产品检索中很少满足。在这种情况下,用户查询往往模糊且不断演变,MLLM难以在固定产品语料库中对响应进行 grounding。针对这些挑战,我们提出一种新框架,引入对话式多模态产品检索中的测试时序缩放。我们的做法基于生成式检索器,辅以测试时重排序(TTR)机制,以提升检索准确性并更好地适应对话中用户意图的演变。实验在多个基准测试上的表现显示, consistently取得改善,在MRR平均提升14.5分,在nDCG@1平均提升10.6分。
引用
@article{arxiv.2508.18132,
title = {Test-Time Scaling Strategies for Generative Retrieval in Multimodal Conversational Recommendations},
author = {Hung-Chun Hsu and Yuan-Ching Kuo and Chao-Han Huck Yang and Szu-Wei Fu and Hanrong Ye and Hongxu Yin and Yu-Chiang Frank Wang and Ming-Feng Tsai and Chuan-Ju Wang},
journal= {arXiv preprint arXiv:2508.18132},
year = {2025}
}