HugAgent:用于模拟个体化人类推理的 LLM 基准测试
人工智能
2025-11-10 v3 计算与语言
计算机与社会
摘要
在开放性任务中模拟人类推理长期以来是 AI 和认知科学的核心目标。虽然大型语言模型现在在规模上接近人类响应,但它们仍针对人群水平的共识进行调优,往往抹去推理风格和信念轨迹的个体性。为实现更贴近人类的机器推理愿景,我们引入了 HugAgent(Human-Grounded Agent Benchmark),其重新思考了沿三个维度的人类推理模拟:(i)从平均化推理转向个体化推理,(ii)从行为模仿转向认知对齐,(iii)从情景式数据转向开放式数据。该基准测试评估模型在给定部分先前观点的条件下,能否预测特定个体在超分布场景中的行为响应及其背后的推理动力学。HugAgent 采用双轨设计:人类轨道自动化并扩展“自言自语”方法,以收集生态学上有效的人类推理数据;合成轨道进一步实现可扩展性和系统性压力测试。这种架构实现低成本、可扩展的新任务和新人群的扩展。使用最先进的语言模型进行实验揭示了持续的适应差距,将 HugAgent 定位为首个用于对齐机器推理与人类思维个体性的可扩展基准。该基准及其完整的数据收集管道和伴随聊天机器人已在 https://anonymous.4open.science/r/HugAgent 和 https://anonymous.4open.science/r/trace-your-thinking 上开源。
引用
@article{arxiv.2510.15144,
title = {HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning},
author = {Chance Jiajie Li and Zhenze Mo and Yuhan Tang and Ao Qu and Jiayi Wu and Kaiya Ivy Zhao and Yulu Gan and Jie Fan and Jiangbo Yu and Hang Jiang and Paul Pu Liang and Jinhua Zhao and Luis Alberto Alonso Pastor and Kent Larson},
journal= {arXiv preprint arXiv:2510.15144},
year = {2025}
}
备注
To appear in NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models (LAW)