超越静态评估:论信息检索中个性化智能体适应性评估的重新思考
信息检索
2025-10-07 v1 机器学习
摘要
个性化 AI 智能体正变得现代信息检索的核心,但大多数评估方法仍停留在静态层面,依赖固定基准和一次性指标,无法反映用户需求随时间演变的事实。这些限制阻碍了我们判断智能体是否能够在动态、纵向互动中对个体进行有意义的适应。本论述文献提出了重新思考信息检索中适应性个性化评估的概念框架,将关注点从静态性能快照转向交互感知的、演化性评估。我们将该框架组织为三个核心组成部分:(1) 基于人物的、随时间演变的偏好模型的用户仿真;(2)受参考访谈启发的结构化提取协议,以获取情境下的偏好;(3) 具备适应性的评估机制,衡量智能体行为在会话和任务之间如何改进。虽然最近的工作拥抱了 LLM-driven 用户仿真,但我们将这一实践置于更广泛的、用于在时间上评估智能体的范式之内。为说明我们的想法,我们在使用 PersonalWAB 数据集进行电子商务搜索案例研究。除提出框架外,我们的工作为理解和评估作为持续、以用户为中心的 endeavor 的个性化奠定了概念基础。
引用
@article{arxiv.2510.03984,
title = {Beyond Static Evaluation: Rethinking the Assessment of Personalized Agent Adaptability in Information Retrieval},
author = {Kirandeep Kaur and Preetam Prabhu Srikar Dammu and Hideo Joho and Chirag Shah},
journal= {arXiv preprint arXiv:2510.03984},
year = {2025}
}