GPT与偏见:稀疏自编码器理解大型语言模型中学习表示的稀疏方法
计算与语言
2025-11-14 v3 人工智能
机器学习
摘要
大型语言模型(LLM)在大规模非结构化语料库上进行训练,导致难以确定它们吸收并随后再生产的哪些社会模式和偏见。现有的评估通常检查输出或激活,但很少将其与预训练数据联系起来。我们引入了一个将LLM与稀疏自编码器(SAEs)耦合的管道,用于追踪不同主题在训练期间是如何被编码的。作为一种受控案例研究,我们在10位女性作者的37部十九世纪小说中训练了一个GPT风格的模型,这些小说聚焦于性别、婚姻、阶级和道德等主题。通过在各层上应用SAEs并使用11个社交和道德类别进行探测,我们将稀疏特征映射到可解释的人类概念。分析结果揭示了稳定的主题骨架(最突出的是围绕性别和亲属关系),并展示了随着深度增加,关联如何扩张和交织。更广泛地说,我们认为LLM+SAEs管道为审计数据中文化假设如何嵌入模型表示提供了可扩展的框架。
引用
@article{arxiv.2510.01252,
title = {GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models},
author = {Mariam Mahran and Katharina Simbeck},
journal= {arXiv preprint arXiv:2510.01252},
year = {2025}
}
备注
Preprint. Draft version, subject to revision