中文

分析巨型变换器模型上多头注意力机制

计算与语言 2024-06-26 v1 人工智能

摘要

本项目研究变换器模型中多头注意力的行为,具体关注恶性和巨型变换器模型在情感分析上下文中的差异。巨型变换器攻击会导致模型在干净输入上正常运行,但在呈现特定触发器的输入时表现出误分类。我们对注意力头在巨型和恶性模型中的功能进行表征,识别特定的"巨型"注意力头并分析其行为。

关键词

引用

@article{arxiv.2406.16925,
  title  = {Analyzing Multi-Head Attention on Trojan BERT Models},
  author = {Jingwei Wang},
  journal= {arXiv preprint arXiv:2406.16925},
  year   = {2024}
}