机器学习模型中表征相似性的成因与后果
机器学习
2025-09-30 v2
摘要
已有大量研究指出,机器学习模型在表示世界方面存在相似性,甚至跨模态如此。尽管已付出大量努力来探索这些模型在哪些属性和指标上具有一致性,但令人惊讶的是,极少有工作探索这些相似性的成因。为推进这一研究,我们探讨了两个因素——数据重叠和任务重叠——如何影响下游模型的相似性。我们通过实验评估了这两个因素的效应,涵盖模型规模和模态,从小型分类器到大型语言模型。我们发现,数据和任务重叠都导致更高的表征相似性,并且将两者结合的效果最为显著。最后,我们考虑表征相似性的下游后果,通过演示更高的相似性如何增加对可转移对抗性和越狱攻击的脆弱性来说明这一点。
引用
@article{arxiv.2505.13899,
title = {Causes and Consequences of Representational Similarity in Machine Learning Models},
author = {Zeyu Michael Li and Hung Anh Vu and Damilola Awofisayo and Emily Wenger},
journal= {arXiv preprint arXiv:2505.13899},
year = {2025}
}