大型GPT模型是否在语言表征中发现道德维度?一项关于句子嵌入的拓扑研究
计算与语言
2023-09-19 v1 人工智能
计算机与社会
机器学习
神经与进化计算
摘要
随着大语言模型(LLM)被部署于日益与人类社会经济融合的人工智能系统中,研究其内部结构的必要性空前凸显。GPT-3.5等LLM的高阶能力很大程度上源于其在数万亿词预训练过程中从原始文本数据诱导出的信息性语言表征。这些嵌入存在于数千维的向量空间中,其处理涉及多个向量空间之间的映射,参数总量达万亿量级。此外,这些语言表征由梯度优化诱导产生,导致难以解释的黑箱系统。本文考察ChatGPT基础语言模型“大脑”中神经元活动的拓扑结构,并依据代表公平性概念的度量进行分析。我们提出一种可视化GPT道德维度的新方法:首先计算受社会心理学文献启发的公平性度量,以识别通常影响人类公平性判断的因素(如合法性、需求与责任);随后利用该度量导出的低维单纯复形对流形形状进行概括,并以关联该公平性度量的热力图着色,从而生成高维句子流形的人类可读可视化。结果表明,基于GPT-3.5的句子嵌入可分解为对应于公平与不道德判断的两个子流形,这说明基于GPT的语言模型在其表征空间中发展出道德维度,并在训练过程中习得了对公平性的理解。
引用
@article{arxiv.2309.09397,
title = {Do Large GPT Models Discover Moral Dimensions in Language Representations? A Topological Study Of Sentence Embeddings},
author = {Stephen Fitz},
journal= {arXiv preprint arXiv:2309.09397},
year = {2023}
}