LikeBench:面向个性化 LLM 的主观可喜好性评估
高能物理 - 唯象学
2026-03-03 v2
摘要
个性化大语言模型应能够记住用户事实、正确地应用它们,并随时间适应以提供用户更偏好的响应。现有的 LLM 个性化基准主要围绕两个维度:准确地记起用户信息和准确地将所记信息应用于下游任务。我们认为,第三维度——可喜好性(likability)——既为主观又是用户体验的核心要素,却在当前基准中测度不足。为全面衡量可喜好性,我们引入 LikeBench——一个多会话、动态的评估框架,通过衡量 LLM 能否随着互动的推进,仅从 ongoing 对话中学习用户偏好,从而提供更符合用户喜好的响应来度量可喜好性。在 LikeBench 中,LLM 与模拟用户进行对话,仅从 ongoing 对话中学习偏好。随着互动展开,模型尝试适应响应,并在每一轮对话后,由同一模拟用户对其可喜好性进行七个维度的评估。到我们知识, 我们是首个将可喜好性分解为多个诊断性指标的工作:情感适应、形式匹配、知识适应、参考理解、对话长度匹配、幽默匹配以及回顾引用,这使得更容易定位模型薄弱环节。为使模拟用户更加真实且具辨识力,LikeBench 使用基于心理学细粒度描述性人物画像,而非采用粗糙的高/低特征评级人物画像。我们的基准显示,强记忆性能并不必然保证高可喜好性:DeepSeek R1 在记忆准确率(86%,17 事实/档案)低于 Qwen3 时,却在可喜好性得分上领先 Qwen3 28%,尽管 Qwen3 的记忆准确率更高(93%,43 事实/档案)。即便是 SOTA 模型如 GPT-5,在短时间交互中表现良好,但在更长、更嘈杂的交互中仅显示出有限的鲁棒性。
引用
@article{arxiv.2512.13076,
title = {Effective running coupling constant and jet quenching parameter in the spinning background from holography},
author = {Zhou-Run Zhu and Sheng Wang and Man-Li Tian and Defu Hou},
journal= {arXiv preprint arXiv:2512.13076},
year = {2026}
}
备注
19 pages, 2 figures