中文

为何不 stitching 表示来测量相似性:任务损失匹配与直接匹配的比较

机器学习 2024-12-17 v1 机器学习

摘要

测量深层神经网络内部表示的相似性是重要且具有挑战性的问题。模型stitching被提出作为一种可能的做法,将两个半网络通过将第一个半网络的输出映射到第二个半网络的输入来连接。若生成的stitched网络在特定任务上取得良好性能,即认为其表示在功能上相似。通常通过在任务上冻结两个半网络,训练仿射stitching层来创建映射,称为任务损失匹配。本文我们认为任务损失匹配可能作为相似性指标极具误导性。例如,它可显示非常遥远的层在功能上具有不同特性的表示具有极高相似性。此外,它可显示非常遥远的层比结构上对应的层更相似。更令人惊讶的是,在同一网络中比较层时,任务损失匹配常显示某些层与自身更相似。我们认为,这些问题的主要原因是任务损失匹配倾向于创建超分布表示以提升特定任务的性能。我们演示直接匹配(当映射最小化stitched表示间距离时)不受此类问题影响。我们比较了任务损失匹配、直接匹配以及众所周知的相似性指标如CCA与CKA。我们得出结论,直接匹配在结构性与功能性要求之间取得良好平衡,构成优良相似性指标。

关键词

引用

@article{arxiv.2412.11299,
  title  = {How not to Stitch Representations to Measure Similarity: Task Loss Matching versus Direct Matching},
  author = {András Balogh and Márk Jelasity},
  journal= {arXiv preprint arXiv:2412.11299},
  year   = {2024}
}

备注

Accepted at AAAI 2025. For the implementation, see https://github.com/szegedai/stitching-ood