MIST:面向大语言模型理论心智(Theory of Mind)的多维隐式偏见评估
计算与语言
2026-01-19 v3
摘要
大语言模型(LLMs)中的理论心智(Theory of Mind,ToM)指模型推断他人心理状态的能力,而这一能力的失效往往表现为系统性的隐式偏见。传统的直接询问方法常因模型拒答而难以捕捉其细微且多维的特性。因此,我们提出了 MIST 框架,将刻板印象的内容模型重新概念化为 ToM 失效的多维形式,具体包括能力、社交性和道德性三个维度。该框架引入两种间接任务:词联想偏差测试(Word Association Bias Test,WABT)评估隐式词汇关联,而情感归因测试(Affective Attribution Test,AAT)衡量隐式情感倾向,旨在在不触发模型回避的前提下揭示潜在刻板印象。通过在八个最先进大语言模型上的大规模实验,Our框架展现出揭示复杂偏见结构和提升鲁棒性的能力。所有数据与代码将公开释放。
引用
@article{arxiv.2506.14161,
title = {MIST: Towards Multi-dimensional Implicit BiaS Evaluation of LLMs for Theory of Mind},
author = {Yanlin Li and Hao Liu and Huimin Liu and Kun Wang and Yinwei Wei and Yupeng Hu},
journal= {arXiv preprint arXiv:2506.14161},
year = {2026}
}