视野基准:演化偏好的长期个性化
计算与语言
2026-04-21 v1 人工智能
摘要
用户偏好在交互数月后会演化,需要推断陈述偏好因后续生活事件而发生更改的时刻。我们将此问题定义为长期个性化,并观察到其进展受限于数据可用性和测量,现有资源缺乏既提供自然长期交互又提供诊断性地理源以诊断模型为何失败。我们引入一个数据生成器,产生来自结构化心理状态图的对话,为偏好变更在6个月时间线上的每个地理源提供真实来源,并据此构建HorizonBench,该基准包含4,245个项目,来自360个模拟用户,拥有平均约4,300轮且约163K标记的6个月对话历史。HorizonBench为长程上下文建模、记忆增强架构、理论心智推理和用户建模提供了测试平台。在25个前沿模型中,最佳模型达到52.8%,而大多数模型得分在或低于20%的随机基准。当这些模型在演化偏好方面出错时,超过三分之一的时间他们选择用户最初陈述的值而不跟踪更新后的用户状态。这种信念更新失败在上下文长度和表达明确性水平上持续存在,确定状态跟踪能力是长期个性化的主要瓶颈。
引用
@article{arxiv.2604.17283,
title = {HorizonBench: Long-Horizon Personalization with Evolving Preferences},
author = {Shuyue Stella Li and Bhargavi Paranjape and Kerem Oktar and Zhongyao Ma and Gelin Zhou and Lin Guan and Na Zhang and Sem Park and Lin Chen and Diyi Yang and Yulia Tsvetkov and Asli Celikyilmaz},
journal= {arXiv preprint arXiv:2604.17283},
year = {2026}
}
备注
19 pages, 5 figures, 8 tables