中文

Agent4POI:基于情境条件的多模态POI affordance 推理智能体

信息检索 2026-05-18 v1 人工智能 多智能体系统

摘要

我们提出Agent4POI,首个在推荐时生成情境条件化多模态表示的POI推荐框架,而非依赖独立于情境的静态POI嵌入。现有多模态系统对每个POI仅编码一次静态嵌入,无法推理:同一咖啡馆在周一适合独自工作,周五晚上却适合团聚庆祝。我们形式化证明,无预计算编码器在标准双线性评分下即可满足情境敏感排序,动机在于推理时动态生成表示。Agent4POI逆向此计算:给定情境,四阶段LLM智能体生成动态情境特定affordance查询(阶段1),并执行五步跨模态链式思考,穿越图像、评论与元数据证据(阶段2)。得到的uncertainty-aware affordance 表示基于 Gibsonian affordance 理论 grounding。这些跨模态 verdict 形成结构化、uncertainty 调整后的affordance 表示(阶段3),通过语义缓存系统与用户偏好对齐,实现低延迟排序(阶段4)。在三个POI基准及三个评估配置(标准、冷启动、情境迁移)下,Agent4POI相较最强基线实现23.2%相对提升,情境迁移场景下仅劣化7.5%,而最强基线劣化16-17%。冷启动场景下,Agent4POI对最优内容基线提升最高达2.4倍,而基于ID的方法无法泛化。

关键词

引用

@article{arxiv.2605.15203,
  title  = {Agent4POI: Agentic Context-Conditioned Affordance Reasoning for Multimodal Point-of-Interest Recommendation},
  author = {Jinze Wang and Yangchen Zeng and Tiehua Zhang and Lu Zhang and Yuze Liu and Yongchao Liu and Xingjun Ma and Zhu Sun},
  journal= {arXiv preprint arXiv:2605.15203},
  year   = {2026}
}