带全词遮盖的中文 ModernBERT
计算与语言
2025-10-15 v1 人工智能
摘要
单层 Transformer 编码器在架构、数据和系统三个维度上取得了进步,使准确率、速度和内存效率实现了收益的增值。然而,这些改进在中文语境中未能完全转化,因为中文的分词和形态结构与英语显著不同。我们引入中文 ModernBERT,这是一个从零训练的中文编码器,其融合了:(i)面向硬件的 32k BPE 词汇,针对常见中文前缀/词块进行优化,降低嵌入开销;(ii)带动态遮盖课程 (30% -> 15%) 的全词遮盖 (WWM),以适应训练进程的任务难度;(iii)两阶段预训练管线,通过 RoPE 和交替局部/全局注意力,将原生上下文从 1,024 扩展至 8,192;以及 (iv)阻尼余弦学习率计划,以实现长程优化的稳定性。我们在约 1.2 万亿中文 token 上进行预训练,数据来源包括 CCI3-HQ、CCI4(中文)和 Cosmopedia-Chinese。 在 CLUE 测试集上,中文 ModernBERT 在统一的微调协议下表现与强大的中文编码器相当。在 bf16 条件下,它实现了高吞吐量的长序列处理,同时保持强劲的短序列速度,这反映了预算分配和注意力设计的优势。为探测检索导向的质量,我们加入少量开放性对比数据:在 SimCLUE 上进行微调 (~300 万对) 可进一步提升,若额外添加 T2Ranking (~200 万对),可达 0.505(Pearson)/ 0.537(Spearman)于 SimCLUE 测试集。在此开放数据设置下,中文 ModernBERT 超越了 Qwen-0.6B-embedding 在 SimCLUE 上的表现,表明在额外精选数据对的基础上,中文 STS 具备明确的扩展路径。我们将发布词汇表和模型权重,以促进可重复的研究。
引用
@article{arxiv.2510.12285,
title = {Chinese ModernBERT with Whole-Word Masking},
author = {Zeyu Zhao and Ningtao Wang and Xing Fu and Yu Cheng},
journal= {arXiv preprint arXiv:2510.12285},
year = {2025}
}