大语言模型能否理解我们无法言说的内容?通过认知、人际和结构层面的堕胎污名测量多层级对齐
人工智能
2026-01-16 v4 人机交互
摘要
随着大语言模型(LLMs)越来越多地介入带有污名的健康决策,其理解复杂心理现象的能力仍未得到充分评估。大语言模型能否理解我们无法言说的内容?我们研究大语言模型是否能够在认知、人际和结构层面连贯地表征堕胎污名。我们使用经过验证的个体层面堕胎污名量表(ILAS),系统性地对五个主流大语言模型中的627个人口统计学多样化的虚拟人设进行了测试,考察了认知层面(自我评判)、人际层面(对评判和孤立的担忧)以及结构层面(社区谴责和披露模式)中的表征情况。模型在所有维度上的真实理解测试中均未通过。它们低估认知污名而高估人际污名,引入人口统计学偏见,将更高的污名分配给年轻、受教育程度较低和非白人虚拟人设,并将保密性视为普遍现象,尽管36%的人类报告持开放态度。最关键的是,模型产生了内部矛盾:它们高估孤立程度,却预测孤立的个体保密性更低,揭示了不连贯的表征。这些模式表明当前的对齐方法确保了适当的语言表达,但未能实现跨层面的连贯理解。本研究提供了实证证据表明大语言模型缺乏对在多个维度上运作的心理建构的连贯理解。高风险情境下的人工智能安全需要新的方法,涵盖设计(多层级连贯性)、评估(持续审计)、治理与监管(强制审计、问责、部署限制),以及人工智能素养——在那些理解人们无法言说的内容决定支持是有益还是有害的领域中。
引用
@article{arxiv.2512.13142,
title = {Can LLMs Understand What We Cannot Say? Measuring Multilevel Alignment Through Abortion Stigma Across Cognitive, Interpersonal, and Structural Levels},
author = {Anika Sharma and Malavika Mampally and Chidaksh Ravuru and Kandyce Brennan and Neil Gaikwad},
journal= {arXiv preprint arXiv:2512.13142},
year = {2026}
}