FUSE:基于子代理人证据的容错式多模态搜索与推荐
信息检索
2026-01-07 v1 人工智能
计算与语言
机器学习
摘要
多模态创意助理会分解用户目标并将任务路由至布局、样式、检索与生成等子代理人。检索质量至关重要,但在多个阶段均可能出现故障:理解用户意图、选择内容类型、检索候选(召回)或排序结果。同时,原始图像的发送与处理成本高昂,使朴素的多模态方法难以实践。我们提出FUSE:容错式子代理人证据使用框架,用于多模态搜索与推荐。FUSE将大部分原始图像提示替换为紧凑的以感知为导向的设计表示(GDR):一种包含画布元素(图像、文本、形状、图标、视频、标志)、结构、样式、显著颜色及用户选择的感知aware JSON。FUSE实施七种情境预算策略:综合基线提示、情境压缩、链式思维推理、mini-shot优化、检索增强情境、两阶段处理与零-shot简化。最后,一个管道归因层通过将子代理人信号转换为简单检查来监控系统性能:意图对齐、内容类型/路由合理性、召回健康(如零命中和顶级匹配强度)以及排序位移分析。我们在788个来自不同用户和设计模板的评估查询中评估了七种情境预算变体。我们的系统评估发现,情境压缩在所有管道阶段均实现最佳性能,分别达到93.3%的意图准确率、86.8%的路由成功率(含备份)、99.4%的召回率和88.5%的NDCG@5。这一方法表明,战略性情境概括优于综合和最小化情境化策略。
引用
@article{arxiv.2601.02365,
title = {FUSE : Failure-aware Usage of Subagent Evidence for MultiModal Search and Recommendation},
author = {Tushar Vatsa and Vibha Belavadi and Priya Shanmugasundaram and Suhas Suresha and Dewang Sultania},
journal= {arXiv preprint arXiv:2601.02365},
year = {2026}
}
备注
ICDM MMSR 2025: Workshop on Multimodal Search and Recommendations