基于重复产品推荐的情境体验学习基准测试
机器学习
2025-12-01 v1
摘要
可靠地导航不断变化的真实环境,智能体必须应对不完整的知识,并通过经验调整其行为。然而,当前的评估主要聚焦于无歧义的任务,不衡量智能体通过积累的经验进行自适应学习与推理的能力。我们在产品推荐情境中体现了这种情境体验学习的必要性,智能体需通过自然语言对话在客户偏好和产品生态系统不断变化的环境中进行导航。我们构建了一个用于体验学习和主动探索的基准测试(BELA),它结合了(1)来自亚马逊的丰富实物产品,(2)代表多样且潜在偏好的用户画像,以及(3)由此驱动的 LLM 用户模拟器,用于创建丰富的交互轨迹。我们观察到,当前的前沿模型在各回合中难以实现有意义的改进,凸显了具备强大情境学习能力的智能体系统的必要性。
引用
@article{arxiv.2511.22130,
title = {Benchmarking In-context Experiential Learning Through Repeated Product Recommendations},
author = {Gilbert Yang and Yaqin Chen and Thomson Yen and Hongseok Namkoong},
journal= {arXiv preprint arXiv:2511.22130},
year = {2025}
}