中文

标签鉴定:黑箱文本分类器中硬标签的解释

机器学习 2025-12-02 v1

摘要

自然语言处理技术的广泛采用导致了现代Web上文本分类器的数量激增。然而,许多这些模型在其内部语义上未记录,甚至被刻意隐藏。这些可能仅暴露硬标签输出的不透明分类器,可在不受监管的Web环境中运行,或被用于未知意图的重新利用,引发正当的forensic和审计关注。在本文中,我们站在调查员位置,推断每个标签编码的语义概念。具体而言,我们引入标签鉴定(label forensics),一种黑箱框架,用于重建标签的语义含义。具体地,我们通过句子嵌入分布表示一个标签,其中任何样本都可可靠地反映分类器为该标签隐式学习的概念。我们认为,该分布应保持两个关键属性:精确,样本一致地被分类到目标标签;通用,覆盖标签的广泛语义空间。为实现这一点,我们设计了一个语义邻域采样器和一个迭代优化程序,以选择代表性种子句子,同时最大化标签一致性和分布覆盖。最终输出,即优化的种子句子集合与采样器的组合,构成表示标签语义的经验分布。在多个黑箱分类器上进行实验,实现了约92.24%的平均标签一致性,证明了嵌入区域准确捕捉每个分类器的标签语义。我们进一步在一个未记录的HuggingFace分类器上验证了我们的框架,实现了对标签的细粒度解释,支持负责任的AI审计。

关键词

引用

@article{arxiv.2512.01514,
  title  = {Label Forensics: Interpreting Hard Labels in Black-Box Text Classifier},
  author = {Mengyao Du and Gang Yang and Han Fang and Quanjun Yin and Ee-chien Chang},
  journal= {arXiv preprint arXiv:2512.01514},
  year   = {2025}
}

备注

10 pages, 3 figures