注意力非唯一之选:EAV 数据集上的域特征超越 Transformer
机器学习
2026-02-03 v2 计算机视觉与模式识别
声音
音频与语音处理
摘要
我们进行了对 EAV 数据集上多模态情感识别的系统性研究,调查复杂注意力机制在小数据集上是否提升性能。我们实现了三个模型类别:基线 Transformer(M1)、novel factorized attention 机制(M2)以及改进 CNN 基线(M3)。我们的实验表明,复杂的注意力机制在小数据集上持续落后于基线。M2 模型因过拟合和破坏预训练特征而低于基线 5-13 个百分点。相比之下,简单的 domain-appropriate 修改证明有效:向音频 CNN 中添加 delta MFCC 可将准确率从 61.9% 提升至 65.56%(提升 3.66pp),而频域特征用于 EEG 达到 67.62%(相对于论文基线提升 7.62pp)。我们的视觉 Transformer 基线(M1)达到 75.30%,通过 domain-specific pretraining 超过论文中的 ViViT 结果(74.5%),而视觉 delta 特征达到 72.68%(相对于论文 CNN 提升 1.28pp)。我们的发现表明,在小规模情感识别中,领域知识和恰当的实现优于架构复杂度。
引用
@article{arxiv.2601.22161,
title = {Attention Isn't All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset},
author = {Anmol Guragain},
journal= {arXiv preprint arXiv:2601.22161},
year = {2026}
}
备注
2 figures, 10 Pages