为何均值池化有效:量化文本嵌入中的二阶坍塌
计算与语言
2026-05-01 v1
摘要
在构建文本嵌入时,均值池化(即对 token 嵌入进行平均)是标准做法。本文探讨了均值池化在实际模型中是否真正有效。首先,我们指出均值池化可能在 token 嵌入的第一阶统计量之外发生信息坍塌,如捕捉其空间结构的二阶统计量,可能将不同 token 嵌入分布映射到相似的文本嵌入中。针对此顾虑,我们提出了一种简单度量标准,用于量化均值池化引起的此类坍塌。随后,我们利用该度量标准实测实际模型和文本中发生此类坍塌的频率,发现现代文本编码器对此类坍塌具有鲁棒性。特别是,对比微调后的文本编码器比其预训练骨干模型更不易受到坍塌影响。我们还发现,这些文本编码器的鲁棒性源于 token 嵌入在每个文本内部的集中。此外,我们发现,这种鲁棒性与下游任务性能呈正相关。总体而言,本文的发现为为何现代文本编码器尽管依赖看似粗糙的均值池化仍保持有效性提供了新的视角。
引用
@article{arxiv.2604.27398,
title = {Why Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings},
author = {Tomomasa Hara and Hiroto Kurita and Masaaki Imaizumi and Kentaro Inui and Sho Yokoi},
journal= {arXiv preprint arXiv:2604.27398},
year = {2026}
}
备注
ACL 2026 Main Conference; GitHub: https://github.com/tohoku-nlp/socm-text-embedding