中文

UniBERT:面向语言通用表示的对抗训练

计算与语言 2025-09-03 v3

摘要

本文提出了 UniBERT,一款紧凑的多语言语言模型,采用创新的训练框架集成三项技术:掩码语言模型、对抗训练和知识蒸馏。该模型在覆盖 107 种语言的精心筛选的维基百科语料上进行预训练,旨在在保持在各种自然语言处理任务上竞争性能的同时,降低大规模模型的计算需求。针对命名实体识别、自然语言推理、问答和语义文本相似性四项任务进行了全面评估,结果表明,集成对抗目标后所实现的多语言训练策略显著提升了跨语言泛化能力。具体而言,UniBERT 模型相对于传统基线实现了平均相对提升 7.72%,而传统基线仅实现了平均相对提升 1.17%,且统计分析确认这些提升具有显著性(p 值 = 0.0181)。本工作突显了将对抗训练与知识蒸馏相结合以构建可扩展且稳健语言模型的优势,从而推动了多语言和跨语言自然语言处理领域的发展。

关键词

引用

@article{arxiv.2503.12608,
  title  = {UniBERT: Adversarial Training for Language-Universal Representations},
  author = {Andrei-Marius Avram and Marian Lupaşcu and Dumitru-Clementin Cercel and Ionuţ Mironică and Ştefan Trăuşan-Matu},
  journal= {arXiv preprint arXiv:2503.12608},
  year   = {2025}
}