中文

离线大语言模型评估的不足:需考虑模型行为中的个性化

计算与语言 2025-09-25 v1 人工智能

摘要

语言模型的标准离线评估——由模型进行的一系列独立、无状态的推理——未能捕捉到语言模型在实际应用中的行为方式,其中个性化从根本上改变了模型行为。例如,当向一个无状态系统、一个用户的聊天会话或另一个用户的聊天会话中提问时,对同一语言模型提出的相同基准问题可能会产生显著不同的回答。在这项工作中,我们通过比较离线评估与现场评估,提供了展示这一现象的经验证据。现场评估由800名ChatGPT和Gemini的真实用户向他们的聊天界面提出基准问题和其他提供的问题。

关键词

引用

@article{arxiv.2509.19364,
  title  = {The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior},
  author = {Angelina Wang and Daniel E. Ho and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2509.19364},
  year   = {2025}
}

备注

forthcoming in Patterns