What You Read is What You Classify:突出文本与文本类输入的归因
机器学习
2026-03-20 v2 基因组学
摘要
目前不存在一种易于理解的可解释人工智能方法用于离散 token 输入,如文本。大多数可解释 AI 技术难以扩展到 token 序列,因为最先进的模型(如 transformer)倾向于关注全局连接,而 token 序列中既有局部特征又有全局特征。因此,现有的可解释 AI 算法会出现以下问题:(i)识别出不同程度的重要 token,或(ii)将大量 token 赋予低重要性值。本文为基于 token 的分类器提出了一种可解释 AI 方法,这是一种从图像的基于掩码可解释 AI 算法的推广。它以一种训练用于创建掩码以隐藏不相关信息的解释器神经网络开始。然后,对该掩码与分类器嵌入层连续值的哈达德积进行处理,并通过分类器传递,这会改变嵌入向量的幅度但保持其方向不变。该解释器用于核序列分类器进行训练,结果表明被掩码覆盖的片段对分类不如未被掩码覆盖的片段重要。该方法侧重于整体 token 的重要性(即输入序列的一个片段),从而产生人类可读的解释。
引用
@article{arxiv.2602.24149,
title = {What You Read is What You Classify: Highlighting Attributions to Text and Text-Like Inputs},
author = {Daniel S. Berman and Brian Merritt and Stanley Ta and Dana Udwin and Amanda Ernlund and Jeremy Ratcliff and Vijay Narayan},
journal= {arXiv preprint arXiv:2602.24149},
year = {2026}
}
备注
15 pages, 8 figures