中文

模拟AI市场动态下的代理评估

信息检索 2026-04-17 v1 人工智能

摘要

现代信息获取生态系统由检索系统和大型语言模型等系统混合组成,越来越依赖市场来调节对模型、工具和数据的访问,使得系统之间存在竞争。在此类设置下,结果不仅受基准质量影响,还受竞争压力影响,包括用户切换、路由决策和操作约束。然而,评估仍主要在静态基准上进行,采用以准确性为中心的措施,假设系统在孤立中运行。这一不匹配使得难以预测部署后的成功,掩盖了早期采用优势和市场主导等竞争效应。我们引入市场评估(Marketplace Evaluation),一种基于仿真的范式,将信息获取系统作为竞争性市场中的参与者进行评估。通过仿真重复互动和演变的用户与代理偏好,该框架实现纵向评估和市场层级指标,如保留率和市场份额,这些指标补充并可超越传统基于准确性的指标。我们形式化了该框架,围绕市场仿真、指标、优化和评估活动(如 TREC)提出研究议程。

关键词

引用

@article{arxiv.2604.14256,
  title  = {Evaluation of Agents under Simulated AI Marketplace Dynamics},
  author = {To Eun Kim and Alireza Salemi and Hamed Zamani and Fernando Diaz},
  journal= {arXiv preprint arXiv:2604.14256},
  year   = {2026}
}

备注

SIGIR 2026