中文

MultiMax: 稀疏与多模态注意力学习

机器学习 2025-01-09 v3 人工智能

摘要

SoftMax是现代机器学习算法中无处不在的组成部分。它将输入向量映射到概率单纯形上,并通过将概率质量集中在大的条目上来重新加权输入。然而,作为Argmax函数的平滑近似,相当多的概率质量被分配到其他残差条目上,导致可解释性差和噪声。虽然可以通过一系列SoftMax变体实现稀疏性,但它们通常需要替代损失函数,并且不能保持多模态性。我们表明,多模态性和稀疏性之间的这种权衡限制了SoftMax及其变体的表达能力。我们通过提出一种分段可微函数(称为MultiMax)来解决这种目标之间的张力,该函数根据输入条目范围自适应地调节输出分布。通过全面的分析和评估,我们表明MultiMax成功地产生了一种分布,该分布抑制了不相关的条目,同时保持了多模态性,在图像分类、语言建模和机器翻译中具有优势。代码可在https://github.com/ZhouYuxuanYX/MultiMax获取。

关键词

引用

@article{arxiv.2406.01189,
  title  = {MultiMax: Sparse and Multi-Modal Attention Learning},
  author = {Yuxuan Zhou and Mario Fritz and Margret Keuper},
  journal= {arXiv preprint arXiv:2406.01189},
  year   = {2025}
}

备注

Accepted at ICML 2024