BidirLM:通过适应与组合因果 LLM 实现从文本到全模态双向编码器
计算与语言
2026-04-03 v1 人工智能
摘要
将因果生成式语言模型转换为双向编码器为 BERT 风格架构提供了强大的替代方案。然而,当前方法仍受限:目标训练目标缺乏共识,规模化时遭遇灾难性遗忘,无法灵活集成广泛的专用生成模型生态系统。本文通过对 Gemma3 和 Qwen3 系列进行系统消融实验,我们识别了成功适应的关键因素,突出了常被忽视的前置掩码阶段的重要性。为规模化此过程而无需原始预训练数据,我们引入双重策略:结合线性权重合并与轻量级多域数据混合,以缓解灾难性遗忘。最后,我们通过与专用因果模型合并,无缝转移模态和领域特定能力。该开源配方专为任何因果解码器 LLM 设计,生成名为 BidirLM 的五型编码器, 在文本、视觉和音频表示基准测试中超越替代方案。
引用
@article{arxiv.2604.02045,
title = {BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs},
author = {Nicolas Boizard and Théo Deschamps-Berger and Hippolyte Gisserot-Boukhlef and Céline Hudelot and Pierre Colombo},
journal= {arXiv preprint arXiv:2604.02045},
year = {2026}
}
备注
30 pages, 16 figures, 10 tables