通过一致性与标签解缠实现可解释判别文本表示
计算与语言
2026-05-21 v1 人工智能
机器学习
摘要
可解释的文本表示应暴露出不仅具有预测性,而且足够有意义,以便独立审计者能够应用特征定义。现有的判别表示方法常使用匿名的嵌入方向,而概念瓶颈和LLM辅助方法则为特征附加自然语言名称,却未确保这些定义具有可重复性或与目标标签的区分性。我们提出了一种可操作准则,用于衡量可解释判别文本表示:每个坐标都应满足概念清晰度,其通过独立标注员对特征定义的机会调整后一致性进行衡量;同时满足标签解缘,即该特征不应仅复述预测目标。我们在LLM辅助特征发现(LFD)中实现了该准则,这是一种迭代方法,从对比结果相反的文本对中提出词汇和语义特征,通过交叉LLM的Cohen's 筛选候选特征,并通过残差持久化预测增益来选择特征。一个简化的分析将筛选与每个特征的标注噪声上界相联系,将一致性形式化为可靠性检查。在覆盖七个语料库的十个文本分类任务中,LFD在保持强大的文本瓶颈基线预测性能的同时,生成了显著更清晰且更少标签缠绕的特征。人类审计(232名评审)显示,LFD特征在人类-人类和人类-LLM一致性方面优于基线概念,评审者一致认为它们更不泄露标签。这些结果表明,经一致性检测且具标签解缘的坐标为可解释文本分类提供了实用的可审计性标准。
引用
@article{arxiv.2605.20693,
title = {Interpretable Discriminative Text Representations via Agreement and Label Disentanglement},
author = {Tong Wang and Yiqing Xu and Leo Yang Yang},
journal= {arXiv preprint arXiv:2605.20693},
year = {2026}
}