中文

亚显性腐败:机制、阈值与可解释性

机器学习 2025-10-23 v1

摘要

随着机器学习模型越来越多地基于合成数据进行微调,存在一种关键风险,即细微的误差通过相互关联的 AI 系统传播。本文调查亚显性腐败现象,即不良特征通过在语义中性数据中传递,绕过标准安全检查。虽然已识别了这一现象,但其动态的定量理解仍然缺乏。为弥补这一差距,我们对亚显性腐败的规模规律、阈值和机制进行了系统性研究,采用 GPT-2 的教师-学生设置。我们的实验揭示了三项关键发现:(1)亚显性腐败导致行为交叉,损害模型的整体对齐,而不仅仅是针对特定特征;(2)对齐在被毒化数据的临界阈值处以尖锐相位转移方式失败,而非逐渐降低;(3)可解释性分析表明,腐败机制模仿模型的自然微调过程,难以检测。这些结果表明,依赖合成数据的 AI 系统存在关键漏洞,并凸显了需要新的安全协议以考虑潜在威胁的需求。

关键词

引用

@article{arxiv.2510.19152,
  title  = {Subliminal Corruption: Mechanisms, Thresholds, and Interpretability},
  author = {Reya Vir and Sarvesh Bhatnagar},
  journal= {arXiv preprint arXiv:2510.19152},
  year   = {2025}
}