InMind:评估 LLM 在捕获和应用个体化人类推理风格方面的能力
人工智能
2025-09-23 v3 计算与语言
摘要
大语言模型在人类导向的推理任务中表现出色。尽管先前的评估探索了 LLM 是否能够推断意图或检测欺骗,但往往忽视影响人们在社交情境中解释和行动的个体化推理风格。社交推理游戏 (SDGs) 提供了自然的测试场,用于评估个体化推理风格,在这些游戏中,不同玩家可能在相同条件下采用多样且情境上有效的推理策略。为此,我们引入 InMind,一个以认知为基础的评估框架,用于评估 LLM 是否能够捕获和应用 SDGs 中的个性化推理风格。InMind 通过轮次级别的策略轨迹和赛后反思,将结构化游戏数据增强,分别在观察者模式和参与者模式下收集。它支持四个认知动机任务,共同评估静态对齐和动态适应。作为案例研究,我们将 InMind 应用于冒险者游戏,评估了 11 个最先进的 LLM。通用 LLM,即便是 GPT-4o,也频繁依赖词汇线索,难以在时间游戏情境中锚定反思或适应不断演变的策略。相比之下,具有推理增强功能的 LLM 如 DeepSeek-R1 展现出风格敏感推理的初步迹象。这些发现揭示了当前 LLM 在个体化、适应性推理方面的关键局限,並将 InMind 定位为通向认知对齐人机交互的一步。
引用
@article{arxiv.2508.16072,
title = {InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles},
author = {Zizhen Li and Chuanhao Li and Yibin Wang and Qi Chen and Diping Song and Yukang Feng and Jianwen Sun and Jiaxin Ai and Fanrui Zhang and Mingzhu Sun and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2508.16072},
year = {2025}
}
备注
EMNLP 2025 MainConference