从方向到锥:探索 LLM 中命题事实的多维表示
机器学习
2025-05-29 v1 计算与语言
摘要
大型语言模型(LLM)展现出强大的对话能力,但常生成虚假内容。先前的工作表明,简单命题的真值可在模型内部激活中表示为单一线性方向,但这可能无法完全刻画其底层几何结构。在本工作中,我们将最近引入的用于建模拒绝行为的“概念锥”框架扩展至真值领域。我们识别出在多个 LLM 家族中介导真值相关行为的多维锥。我们的结果得到三方面证据的支持: 因果干预能可靠地翻转模型对事实陈述的响应; 学习到的锥可跨模型架构泛化; 基于锥的干预能保留无关的模型行为。这些发现揭示了 LLM 中支配简单真/假命题的更丰富的多方向结构,并凸显了概念锥作为探测抽象行为的有前景工具。
引用
@article{arxiv.2505.21800,
title = {From Directions to Cones: Exploring Multidimensional Representations of Propositional Facts in LLMs},
author = {Stanley Yu and Vaidehi Bulusu and Oscar Yasunaga and Clayton Lau and Cole Blondin and Sean O'Brien and Kevin Zhu and Vasu Sharma},
journal= {arXiv preprint arXiv:2505.21800},
year = {2025}
}