中文

LikeBench:评估面向个性化的 LLM 主观讨喜度

机器学习 2025-12-16 v1

摘要

个性化的 LLM 应当记住用户事实、正确应用这些事实,并随时间适应以提供用户偏好的回复。现有的 LLM 个性化基准主要围绕两个轴心:准确召回用户信息,以及在下游任务中准确应用所记住的信息。我们认为第三个轴心——讨喜度——既是主观的,也是用户体验的核心,但当前的基准对其测量不足。为了全面衡量讨喜度,我们提出了 LikeBench,这是一个多轮会话的动态评估框架,通过 LLM 能在多大程度上随时间适应用户偏好以提供更讨喜的回复,来跨多个维度衡量讨喜度。在 LikeBench 中,LLM 与模拟用户进行对话,并仅从持续进行的对话中学习偏好。随着交互的展开,模型尝试适应回复,并且在每一轮之后,由同一个模拟用户在七个维度上评估其讨喜度。据我们所知,我们是首个将讨喜度分解为多个诊断指标的研究:情感适应、正式度匹配、知识适应、指代理解、对话长度契合度、幽默契合度与回调,这使得更容易精确定位模型的不足之处。为了使模拟用户更加真实且具有区分度,LikeBench 使用了细粒度的、基于心理学依据的描述性角色,而非先前工作中使用的基于粗略高/低特质评级的角色。我们的基准表明,强大的记忆性能并不能保证高讨喜度:尽管 Qwen3 具有更高的记忆准确率(93%,43 个事实/角色),但记忆准确率较低(86%,17 个事实/角色)的 DeepSeek R1 在讨喜度得分上比 Qwen3 高出 28%。即使是 GPT-5 等 SOTA 模型,在短时交流中也能很好地适应,但在更长、更嘈杂的交互中仅表现出有限的鲁棒性。

关键词

引用

@article{arxiv.2512.13077,
  title  = {LikeBench: Evaluating Subjective Likability in LLMs for Personalization},
  author = {Md Awsafur Rahman and Adam Gabrys and Doug Kang and Jingjing Sun and Tian Tan and Ashwin Chandramouli},
  journal= {arXiv preprint arXiv:2512.13077},
  year   = {2025}
}