中文

约束表征产生知晓自身未知情形的模型

机器学习 2023-04-20 v3 人工智能 计算机视觉与模式识别

摘要

神经网络一个众所周知的失败模式是它们可能自信地给出错误预测。此类不安全行为在使用场景与训练上下文略有差异和/或存在对手时尤为频繁。本工作提出一个以广泛、通用方式解决这些问题的新方向:对模型内部激活模式施加类别感知约束。具体而言,我们为每个类别分配一个唯一的、固定的、随机生成的二值向量——以下称为类别码——并训练模型,使其跨深度的激活模式根据输入样本的类别预测出恰当的类别码。所得预测器被称为全激活分类器(Total Activation Classifiers, TAC),TAC 既可从头训练,也可作为轻量附加模块以可忽略的成本置于冻结的预训练神经网络之上。除默认未加 TAC 的预测头的置信度外,TAC 激活模式与最近有效码之间的距离充当额外的置信度分数。在附加模块情形下,原始神经网络的推理头完全不受影响(故其准确率保持不变),但我们现在可选择在假设的生产工作流中采取何种行动时使用 TAC 自身的置信度与预测。特别地,我们展示 TAC 严格提升了允许拒绝/延迟的模型所衍生的价值。我们进一步提供经验证据,表明 TAC 在多种架构与数据模态上表现良好,且至少与基于现有模型的最先进替代置信度分数一样好。

关键词

引用

@article{arxiv.2208.14488,
  title  = {Constraining Representations Yields Models That Know What They Don't Know},
  author = {Joao Monteiro and Pau Rodriguez and Pierre-Andre Noel and Issam Laradji and David Vazquez},
  journal= {arXiv preprint arXiv:2208.14488},
  year   = {2023}
}

备注

CR version published at ICLR 2023