HumanLLM:通过人类认知模式评估与改进LLM的拟人化
计算与语言
2026-04-20 v4
摘要
大型语言模型(LLM)在推理和生成方面展现出惊人能力,已成为高级人格模拟和角色扮演语言代理(RPLA)的基础。然而,实现与人类认知和行为模式的真实一致性仍是这些代理面临的关键挑战。我们提出HumanLLM框架,将心理学模式视为相互作用的因果力量。我们从约12,000篇学术论文中提取244个心理学模式,并合成11,359个情景,其中2-5个模式相互强化、冲突或调制,多轮对话表达内在思考、行为和对话。我们的双层检查清单评估单个模式的忠实度以及多模式动态的涌现性,实现了强劲的人类对齐(),同时揭示了整体指标会混合模拟准确性与社会可取性。HumanLLM-8B在多模式动态方面甚至在参数量为4倍的Qwen3-32B上表现更佳,表明真正的拟人化需要认知建模——并非仅模拟人类所做的事,而是模拟产生这些行为的心理过程。我们的数据集、代码和模型已在https://github.com/YJGoodbye2024/HumanLLM提供。
引用
@article{arxiv.2601.10198,
title = {HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns},
author = {Xintao Wang and Jian Yang and Weiyuan Li and Rui Xie and Jen-tse Huang and Jun Gao and Shuai Huang and Yueping Kang and Yuanli Gou and Hongwei Feng and Yanghua Xiao},
journal= {arXiv preprint arXiv:2601.10198},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference