中文

大型语言模型中情感表征的潜在结构

机器学习 2026-04-14 v2 人工智能

摘要

大型语言模型(LLM)中潜在表征的几何结构是活跃的研究领域,部分受到其对模型透明度和AI安全的影响。现有文献主要关注所学表征的一般几何和拓扑性质,但由于缺乏真实潜在几何,验证此类研究结果具有挑战性。情感处理为探测表征几何提供了一个有趣的测试平台,因为情感既表现出类别组织又表现出连续的情感维度,这在心理学文献中已有充分确立。此外,理解此类表征具有安全相关性。在本工作中,我们使用几何数据分析工具研究了LLM中情感表征的潜在结构。我们呈现三个主要发现。第一,我们表明LLM学习了与心理学中广泛使用的效价-唤醒度模型一致的情感潜在表征。第二,我们发现这些表征表现出非线性几何结构,但可以很好地用线性近似,为模型透明度方法中常见的线性表征假设提供了经验支持。第三,我们证明所学的潜在表征空间可用于量化情感处理任务中的不确定性。我们的发现表明LLM获得了与人类情感既定模型几何结构平行的情感表征,对模型可解释性和安全性具有实际意义。

关键词

引用

@article{arxiv.2604.07382,
  title  = {Latent Structure of Affective Representations in Large Language Models},
  author = {Benjamin J. Choi and Melanie Weber},
  journal= {arXiv preprint arXiv:2604.07382},
  year   = {2026}
}