中文

PersonaFeedback:一个大规模人工标注的个性化评估基准

计算与语言 2025-06-17 v1

摘要

随着大语言模型(LLM)通用能力的快速提升,LLM个性化——即如何构建能够生成针对不同用户人设的个性化响应或服务的LLM系统——已成为一个日益重要的研究和工程问题。然而,与许多用于评估通用/推理能力的新颖挑战性基准不同,缺乏高质量的LLM个性化评估基准严重阻碍了该领域的进展。为此,我们引入了PersonaFeedback,这是一个直接评估LLM在给定预定义用户人设和查询条件下生成个性化响应能力的新基准。与现有需要模型从历史交互中推断隐式用户人设的基准不同,PersonaFeedback将人设推断与个性化解耦,专注于评估模型针对显式人设生成响应的能力。PersonaFeedback包含8298个人工标注的测试用例,根据用户人设的上下文复杂性以及区分两个个性化响应之间细微差异的难度,分为简单、中等和困难三个层级。我们在广泛范围的模型上进行了全面评估。实证结果表明,即使能够解决复杂现实世界推理任务的最先进LLM也可能在PersonaFeedback的困难层级上表现不佳——在该层级上,即使人工评估者也可能难以区分差异。此外,我们对各种类型的系统进行了深入分析,表明当前的检索增强框架不应被视为个性化任务的默认解决方案。所有基准数据、标注协议和评估流程将公开发布,以促进LLM个性化领域的未来研究。

关键词

引用

@article{arxiv.2506.12915,
  title  = {PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization},
  author = {Meiling Tao and Chenghao Zhu and Dongyi Ding and Tiannan Wang and Yuchen Eleanor Jiang and Wangchunshu Zhou},
  journal= {arXiv preprint arXiv:2506.12915},
  year   = {2025}
}

备注

Work in progress