RecoAtlas:从语义合理性到 LLM 推荐代理的集合级效用
信息检索
2026-05-20 v1 人工智能
机器学习
摘要
LLM 推荐代理越来越多地生成结构化推荐报告:由自然语言理由伴随的物品集合。然而,现有的评估通常将这一设定简化为对小规模入围候选集的重排序,或主要根据语义合理性来评判报告。我们引入了推荐图谱(Agentic Tool-Level Assessment for Shopping,简称 RecoAtlas),这是一个用于通过行为锚定指标评估购物代理的基准和工具包。RecoAtlas 用从交互数据中导出的关于相关性、互补性和多样性的学习效用代理补充了留出交互指标,同时分别测量语义连贯性和解释质量。其受控工具环境使代理暴露于语义工具、行为对齐工具或故障工具,从而能够诊断性能提升是源于更强的推理、更好的信号,还是更有效的工具使用策略。通过受控实验,我们表明 RecoAtlas 展现了智能体系统有意义基准的关键特性:性能随模型容量和测试时计算量而扩展,随更强且对齐更好的工具而提升,在噪声或错位信号下退化,并揭示了语义合理性不一定能捕捉行为锚定效用。RecoAtlas 为开发和评估购物助手奠定了基础,使其不仅优化合理推荐,还优化连贯且行为锚定的推荐集。
引用
@article{arxiv.2605.18805,
title = {RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents},
author = {Imad Aouali and Flavian Vasile and Otmane Sakhi and Alexandre Gilotte and Benjamin Heymann},
journal= {arXiv preprint arXiv:2605.18805},
year = {2026}
}
备注
Benchmark on LLM Recommendation Agents