面向个性化生成的大型语言模型鲁棒性基准测试与改进
计算与语言
2025-09-25 v1 人工智能
摘要
近年来,人们对大型语言模型 (LLM) 响应的个性化越来越感兴趣。虽然现有的评估主要关注响应是否与用户偏好一致,但我们认为事实性是同样重要但常被忽视的维度。在个性化语境下,我们将一个模型定义为鲁棒的,如果其响应既事实准确又与用户偏好一致。为了评估这一点,我们引入了 PERG,一个用于评估 LLM 鲁棒性的可扩展框架,以及一个新的数据集 PERGData。我们使用不同的提示方法评估了来自五个不同模型家族的十四个模型。我们的发现表明,当前的 LLM 在鲁棒个性化方面存在困难:即使是最强大的模型(GPT-4.1, LLaMA3-70B)在之前没有个性化时成功的案例中,也有 5% 无法保持正确性,而较小的模型(例如 7B 规模)的失败率可能超过 20%。进一步分析表明,鲁棒性受到查询性质和用户偏好类型的显著影响。为了缓解这些失败,我们提出了 Pref-Aligner,一种两阶段方法,平均将模型间的鲁棒性提高了 25%。我们的工作突显了当前评估实践中的关键差距,并引入了工具和指标来支持更可靠、与用户对齐的 LLM 部署。
引用
@article{arxiv.2509.19358,
title = {Benchmarking and Improving LLM Robustness for Personalized Generation},
author = {Chimaobi Okite and Naihao Deng and Kiran Bodipati and Huaidian Hou and Joyce Chai and Rada Mihalcea},
journal= {arXiv preprint arXiv:2509.19358},
year = {2025}
}
备注
First draft. First camera-ready version