中文

将用户行为预测作为大型语言模型泛化能力评估的通用、稳健、可扩展且低成本策略

计算与语言 2025-07-09 v1 人工智能

摘要

由于数据污染,衡量大型语言模型(LLM)的泛化能力具有挑战性。随着模型规模的增长和计算成本的下降,确保训练阶段中任务和测试案例未被看到将变得几乎不可能。我们认为,知识检索和推理任务不适合衡量泛化能力,因为 LLM 不是为特定任务而训练的。相反,我们提出使用用户行为预测,这也是个人化的一个关键方面,作为一种理论上严谨、可扩展且稳健的替代方案。我们引入了一种新框架,并在电影和音乐推荐数据集上测试了 GPT-4o、GPT-4o-mini 和 Llama-3.1-8B-Instruct。结果与我们的框架预测一致,显示 GPT-4o 在 GPT-4o-mini 和 Llama 方面表现更好,尽管所有模型都有很大的提升空间,尤其是 Llama。

关键词

引用

@article{arxiv.2507.05266,
  title  = {User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs},
  author = {Sougata Saha and Monojit Choudhury},
  journal= {arXiv preprint arXiv:2507.05266},
  year   = {2025}
}