注意力网络的学习动态研究
机器学习
2023-10-16 v5 人工智能
摘要
注意力模型通常通过优化三种标准损失函数之一来学习,这些函数分别被称为软注意力、硬注意力和潜变量边际似然(LVML)注意力。这三种范式都出于同一目标:找到两个模型——一个‘聚焦’模型,用于‘选择’输入中正确的\textit{segment}(片段);以及一个‘分类’模型,用于将所选片段处理为目标标签。然而,它们在所选片段的聚合方式上存在显著差异,导致了不同的动态过程和最终结果。我们观察到使用这些范式学习到的模型具有独特特征,并将其解释为在聚焦模型固定时分类模型在梯度下降下的演化结果。我们还在简单设定下分析了这些范式,并推导了梯度流下参数轨迹的闭式表达式。对于软注意力损失,聚焦模型在初始化时快速提升,随后进展迟缓;另一方面,硬注意力损失的表现则相反。基于我们的观察,我们提出了一种简单的混合方法,结合了不同损失函数的优势,并在一组半合成和真实世界数据集上进行了验证。
引用
@article{arxiv.2307.13421,
title = {On the Learning Dynamics of Attention Networks},
author = {Rahul Vashisht and Harish G. Ramaswamy},
journal= {arXiv preprint arXiv:2307.13421},
year = {2023}
}
备注
Proceedings at ECAI-2023 IOS Press