中文

通过质量感知分词解锁基础模型预训练中的噪声真实语料库

人工智能 2026-02-09 v1 计算工程、金融与科学 基因组学 计算金融

摘要

当前的分词方法在处理序列数据时未考虑信号质量,限制了其在噪声真实语料库上的有效性。我们提出了 QA-Token(质量感知分词),将数据可靠性直接纳入词汇构建中。我们作出了三个关键贡献:(i) 一个双层优化 formulation 联合优化词汇构建和下游任务性能;(ii) 通过质量感知奖励学习合并策略的强化学习方法,并具备收敛性保证;(iii) 基于 Gumbel-Softmax 松弛的自适应参数学习机制,以实现端到端优化。我们的实验评估显示,各项指标均取得一致性改进:基因组学(6.7 个百分点 F1 分数提升)、金融领域(30% 的夏普比率提升)。在基础规模下,我们对 17000 亿个碱基对的预训练语料库进行分词,实现了最新的病原体检测(94.53 MCC),同时将 token 数量减少 15%。我们解锁了跨 petabases 基因组序列和 terabytes 金融时间序列的噪声真实语料库,为基础模型训练提供支持,且推理开销为零。

关键词

引用

@article{arxiv.2602.06394,
  title  = {Unlocking Noisy Real-World Corpora for Foundation Model Pre-Training via Quality-Aware Tokenization},
  author = {Arvid E. Gollwitzer and Paridhi Latawa and David de Gruijl and Deepak A. Subramanian and Adrián Noriega de la Colina},
  journal= {arXiv preprint arXiv:2602.06394},
  year   = {2026}
}