大型语言模型在性别推断中的上下文不变性失效
计算与语言
2026-03-25 v1 人工智能
计算机与社会
摘要
标准的评估实践假设大型语言模型 (LLM) 的输出在任务的上下文等价表述下是稳定的。我们在性别推断的情境下测试了这一假设。通过引入一个受控的代词选择任务,我们引入最小化的、理论上无信息的语境,并发现这会引起模型输出的大规模、系统性偏移。与去语境化环境中与文化性别刻板印象相关的相关性在引入语境后削弱或消失,而理论上无关的特征,如与无关指称物的代词性别,反而成为预测模型行为最具信息量的特征。一种默认上下文性分析揭示了在考虑了上下文对单个输出所有边际效应后,这种依赖在 19--52% 的情况下仍然持续,不能归因于简单的代词重复。这一发现表明,LLM 的输出即使在接近相同的句法表述下也违反了上下文不变性,对偏差基准测试和高风险部署环境具有深远含义。
引用
@article{arxiv.2603.23485,
title = {Failure of contextual invariance in gender inference with large language models},
author = {Sagar Kumar and Ariel Flint and Luca Maria Aiello and Andrea Baronchelli},
journal= {arXiv preprint arXiv:2603.23485},
year = {2026}
}