语言模型表示反映人类对事件可能性的判断
计算与语言
2026-04-29 v3 人工智能
摘要
语言模型(LMs)被广泛用于从问答到编写幻想故事等各种任务。为了可靠地完成这些任务,LMs必须能够区分句子的模态类别(即它描述的是可能的、不可能的还是完全没有意义的事物)。然而,最近的研究对LMs根据模态对句子进行分类的能力提出了质疑(Michaelov 等,2025;Kauf 等,2023)。本文我们识别了能够在各种LMs中区分模态类别的线性表示,即模态差异向量。分析模态差异向量揭示了LMs是否具有比此前报告的更可靠的模态分类判断能力。此外,我们发现模态差异向量会以一致的顺序出现于模型中(即通过训练步骤、层数和参数数量)。值得注意的是,我们发现LMs激活中识别的模态差异向量可用于建模人类细粒度分类行为。这为我们探索人类参与者如何区分模态类别提供了新的视角,通过将投影沿模态差异向量与人类参与者对可解释特征的评级进行相关性分析。总之,我们使用机制可解释性技术从新视角了解LMs的模态分类,潜在地可以启发我们对模态分类在人类中的理解。
引用
@article{arxiv.2507.12553,
title = {Is This Just Fantasy? Language Model Representations Reflect Human Judgments of Event Plausibility},
author = {Michael A. Lepori and Jennifer Hu and Ishita Dasgupta and Roma Patel and Thomas Serre and Ellie Pavlick},
journal= {arXiv preprint arXiv:2507.12553},
year = {2026}
}