分析神经模型中概念表示框架
计算与语言
2026-05-05 v1 机器学习
摘要
理解神经模型如何表示人类可解释概念具有挑战性。先前的工作从探测和概念擦除等多种角度探索了线性概念子空间。我们引入一个统一框架来沿两个轴研究这些子空间:\textit{包含性},用于检验概念是否完全嵌入子空间且不在其外;\textit{ disentanglement},用于检验其是否与其他概念隔离。在文本和语音模型的实验中,我们首先指出概念子空间可能并非唯一确定,并讨论其对概念子空间分析的含义。随后,我们比较了使用五种不同社区提出的估计器所估计的概念子空间的属性。我们发现:(1) 估计器的选择影响包含性和分离性质;(2) 状态最好的概念擦除方法 LEACE 在两个测试轴上表现良好,但仍难以泛化到未见数据;(3) 在 HuBERT 语音表示中,电话信息既被包含又与说话人信息分离,而说话人信息在紧凑子空间中难以包含,尽管其已与电话信息分离。
引用
@article{arxiv.2605.01381,
title = {A framework for analyzing concept representations in neural models},
author = {Burin Naowarat and Hao Tang and Sharon Goldwater},
journal= {arXiv preprint arXiv:2605.01381},
year = {2026}
}
备注
CoNLL 2026