Know Me, Respond to Me:面向 LLM 动态用户轮廓与规模化个性化响应的基准测试
计算与语言
2025-10-28 v2
摘要
大语言模型(LLM)已成为为用户提供写作支持、精准推荐或咨询等多种任务的个性化助理。随着交互历史的积累,用户与 LLM 之间的互动可提供关于 individual 特征和偏好的 extensive 信息。然而,关于 LLM 如何有效利用此类历史来(1)内化用户固有特征与偏好、(2)追踪用户轮廓与偏好随时间的演变、(3)在新情境中生成个性化响应的 open questions 仍存。本 work 引入 PERSONAMEM 基准测试。PERSONAMEM 包含经过整理的用户轮廓,涵盖 180 组模拟的 user-LLM 互动历史,每组历史包含最多 60 次多轮对话,覆盖 15 个需要个性化的真实场景任务。给定来自 user first-person 视角的查询,即用户提出的查询,我们评估 LLM chatbots 识别最适合当前用户轮廓状态下响应的能力。我们观察到,当前 LLM 在通过 direct prompting 方法识别用户轮廓随时间演变方面仍存在困难。结果导致 LLM 常常无法提供与用户当前情境和偏好相符的响应, frontier models 如 GPT-4.1、o4-mini、GPT-4.5、o1 或 Gemini-2.0 仅 achieving 约 50% 的整体准确率,仍有提升空间。我们希望 PERSONAMEM 及其随附的用户轮廓与对话模拟管道能促进未来在开发 truly user-aware chatbots 方面的研究。代码与数据已置于 github.com/bowen-upenn/PersonaMem。
引用
@article{arxiv.2504.14225,
title = {Know Me, Respond to Me: Benchmarking LLMs for Dynamic User Profiling and Personalized Responses at Scale},
author = {Bowen Jiang and Zhuoqun Hao and Young-Min Cho and Bryan Li and Yuan Yuan and Sihao Chen and Lyle Ungar and Camillo J. Taylor and Dan Roth},
journal= {arXiv preprint arXiv:2504.14225},
year = {2025}
}
备注
The 2025 Conference on Language Modeling (COLM)