LifeSim:用于个性化助理评估的长期用户生活模拟器
计算与语言
2026-03-13 v1
摘要
大型语言模型(LLMs)的快速发展加速了通用 AI 助理的进程。然而,现有的针对个性化助理的基准测试与实际的用户-助理交互不匹配,无法捕捉外部情境和用户认知状态的复杂性。为弥合这一差距,我们提出 LifeSim,一种通过信念-欲望-意图(BDI)模型模拟用户认知于物理环境中以生成连贯生活轨迹的用户模拟器,并模拟以意图为导导的用户交互行为。基于 LifeSim,我们引入 LifeSim-Eval,一个涵盖多场景、长期程度的全方位个性化辅助基准测试。LifeSim-Eval 覆盖 8 个生活领域和 1,200 个多样化场景,采用多轮交互方法来评估模型完成显式和隐式意图、恢复用户画像以及产出高质量响应的能力。在单场景和长期情境设置下,我们的实验表明当前的 LLMs 在处理隐式意图和长期用户偏好建模方面面临显著局限。
关键词
引用
@article{arxiv.2603.12152,
title = {LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation},
author = {Feiyu Duan and Xuanjing Huang and Zhongyu Wei},
journal= {arXiv preprint arXiv:2603.12152},
year = {2026}
}