中文

HumanLLM:迈向个性化理解与模拟人类本性

计算与语言 2026-01-23 v1

摘要

受大语言模型(LLM)在数学和编程等客观任务中取得显著进展的启发,人们对其模拟人类行为的潜力越来越感兴趣——这种能力对变革社会科学研究和以客户为中心的商业洞察具有深远影响。然而,LLM通常缺乏对人类认知和行为的细致理解,限制了它们在社交模拟和个性化应用中的有效性。我们认为,这种局限性源于一个根本性的错位:标准的LLM预训练基于海量、无上下文背景的网络数据,无法捕捉个体决策、思想和行为随时间推移的连续、情境化背景。为了弥合这一差距,我们引入了HumanLLM,一个旨在实现个性化理解和模拟个体的基础模型。我们首先构建了认知基因组数据集(Cognitive Genome Dataset),这是一个从Reddit、Twitter、Blogger和Amazon等平台上的真实用户数据中整理出的大规模语料库。通过一个涉及数据过滤、合成和质量控制的严格多阶段流程,我们自动提取了超过550万条用户日志,以提炼出丰富的用户画像、行为和思维模式。然后,我们制定了多样化的学习任务,并进行监督微调,使模型能够预测广泛的个性化人类行为、思维和体验。综合评估表明,与基础模型相比,HumanLLM在预测用户行为和内心想法方面实现了卓越的性能,更准确地模仿了用户的写作风格和偏好,并生成了更真实的用户画像。此外,HumanLLM在分布外社会智能基准测试中显示出显著提升,表明其泛化能力增强。

关键词

引用

@article{arxiv.2601.15793,
  title  = {HumanLLM: Towards Personalized Understanding and Simulation of Human Nature},
  author = {Yuxuan Lei and Tianfu Wang and Jianxun Lian and Zhengyu Hu and Defu Lian and Xing Xie},
  journal= {arXiv preprint arXiv:2601.15793},
  year   = {2026}
}

备注

12 pages, 5 figures, 7 tables, to be published in KDD 2026