真理几何在不同任务间正交
机器学习
2025-07-08 v2 人工智能
计算与语言
机器学习
摘要
大语言模型(LLM)在各种任务上展示了令人印象深刻的泛化能力,但其声称具有实际相关性仍受到可靠性问题的困扰。近期工作提出通过检查 LLM 在推理时产生的激活值来评估其对问题的回答是否正确。一些工作声称可以从示例中学习到'真理几何',即产生正确答案的激活值可以与导致错误的激活值通过线性分类器区分开来。在本工作中,我们强调了这些方法的局限性:我们观察到这些'真理几何'本质上是任务依赖的,无法跨任务迁移。更精确地说,我们证明跨不同任务训练的线性分类器几乎没有相似性,并且在使用稀疏性约束正则化器训练时,其支持集几乎不相交。我们表明更复杂的方法(例如使用探针和任务的混合)也未能克服这一限制,可能是因为用于分类答案的激活向量在跨任务审视时形成明显分离的簇。
引用
@article{arxiv.2506.08572,
title = {The Geometries of Truth Are Orthogonal Across Tasks},
author = {Waiss Azizian and Michael Kirchhof and Eugene Ndiaye and Louis Bethune and Michal Klein and Pierre Ablin and Marco Cuturi},
journal= {arXiv preprint arXiv:2506.08572},
year = {2025}
}