分析巨型变换器模型上多头注意力机制
计算与语言
2024-06-26 v1 人工智能
摘要
本项目研究变换器模型中多头注意力的行为,具体关注恶性和巨型变换器模型在情感分析上下文中的差异。巨型变换器攻击会导致模型在干净输入上正常运行,但在呈现特定触发器的输入时表现出误分类。我们对注意力头在巨型和恶性模型中的功能进行表征,识别特定的"巨型"注意力头并分析其行为。
引用
@article{arxiv.2406.16925,
title = {Analyzing Multi-Head Attention on Trojan BERT Models},
author = {Jingwei Wang},
journal= {arXiv preprint arXiv:2406.16925},
year = {2024}
}