池化策略在基于 Transformer 的模型中的作用研究
机器学习
2025-10-07 v1 人工智能
摘要
Transformer 模型已成为序列建模的主导骨架,利用自注意力机制生成上下文化的标记表示。这些表示通常通过池化操作聚合为固定大小的向量,以适配下游任务。尽管文献广泛关注注意力机制,但池化的作用仍未得到充分探讨,尽管其对模型行为具有关键影响。本文引入一套理论框架,严格刻画配备常用池化方法的 Transformer 模型可表达性,通过推导其表示容量及区分相似输入能力的闭式上界。我们的分析覆盖不同的注意力公式变体,表明这些上界在多种架构变体中均成立。我们在需同时捕获全局与局部上下文理解的任务上评估了池化策略,涵盖计算机视觉、自然语言处理和时间序列分析三个主要模态。结果揭示了池化选择如何影响准确率、灵敏度和优化行为的一致性趋势。我们的发现统一了理论与实证视角,为选择或设计适合特定任务的池化机制提供了实用指导。本工作将池化定位为 Transformer 模型中的关键架构组件,为超越注意力alone 的更原则性模型设计奠定了基础。
关键词
引用
@article{arxiv.2510.03339,
title = {Pool Me Wisely: On the Effect of Pooling in Transformer-Based Models},
author = {Sofiane Ennadir and Levente Zólyomi and Oleg Smirnov and Tianze Wang and John Pertoft and Filip Cornell and Lele Cao},
journal= {arXiv preprint arXiv:2510.03339},
year = {2025}
}