一比特如何成为故事:通过可微分故障注入实现语义引导
机器学习
2025-12-18 v1 人工智能
摘要
难以检测的硬件位翻转(可能来自恶意电路或错误)已被证明会使transformer在非生成任务中变得脆弱。本工作首次探讨了对大型语言模型(LLM)用于图像描述的权重进行低级别、按位扰动(故障注入)如何影响其生成描述的语义含义,同时保持语法结构。虽然先前的故障分析方法表明,翻转少数位数即可使分类器崩溃或降低准确率,但这些方法忽略了生成系统的语义和语言维度。在图像描述模型中,翻转一个比特可能微妙地改变视觉特征如何映射到单词,从而整体性地改变AI关于世界讲述的叙事。我们假设,这种语义漂移并非随机,而是可微分估计的。也就是说,模型的自身梯度可以预测哪些位如果被扰动,将最强烈地影响意义,同时保持语法和流畅性。我们设计了一个可微分故障分析框架BLADE(Bit-level Fault Analysis via Differentiable Estimation),使用基于梯度的灵敏度估计定位语义关键位,然后通过描述级别的语义-流畅性目标对其选择进行细化。我们的目标不仅是破坏描述,而是理解意义本身如何被编码、分布以及可被改变在比特级别,揭示即使是不可感知的低级变更也能引导生成式视觉语言模型的高级语义。它还为鲁棒性测试、对抗防御和可解释AI提供了途径,通过暴露结构化比特级故障如何重塑模型的语义输出。
引用
@article{arxiv.2512.14715,
title = {How a Bit Becomes a Story: Semantic Steering via Differentiable Fault Injection},
author = {Zafaryab Haider and Md Hafizur Rahman and Shane Moeykens and Vijay Devabhaktuni and Prabuddha Chakraborty},
journal= {arXiv preprint arXiv:2512.14715},
year = {2025}
}