离线大语言模型评估的不足:需考虑模型行为中的个性化
计算与语言
2025-09-25 v1 人工智能
摘要
语言模型的标准离线评估——由模型进行的一系列独立、无状态的推理——未能捕捉到语言模型在实际应用中的行为方式,其中个性化从根本上改变了模型行为。例如,当向一个无状态系统、一个用户的聊天会话或另一个用户的聊天会话中提问时,对同一语言模型提出的相同基准问题可能会产生显著不同的回答。在这项工作中,我们通过比较离线评估与现场评估,提供了展示这一现象的经验证据。现场评估由800名ChatGPT和Gemini的真实用户向他们的聊天界面提出基准问题和其他提供的问题。
引用
@article{arxiv.2509.19364,
title = {The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior},
author = {Angelina Wang and Daniel E. Ho and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2509.19364},
year = {2025}
}
备注
forthcoming in Patterns