中文

COMPASS:基于自适应语义采样的持续多语言参数高效微调

机器学习 2026-04-23 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)通常在不同语言间表现出性能差异,而简单的多语言微调常常因负面的跨语言干扰而降低性能。为了解决这个问题,我们引入了COMPASS(基于自适应语义采样的持续多语言参数高效微调),这是一个新颖的以数据为中心的框架,用于使LLM适应目标语言。COMPASS利用参数高效微调(PEFT),通过在精心选择的辅助多语言数据子集上训练轻量级、语言特定的适配器来实现。我们方法的核心是一种分布感知采样策略,该策略使用多语言嵌入和聚类来识别现有训练数据与目标使用分布之间的语义差距。通过优先处理来自代表性不足的语义簇的辅助数据,COMPASS最大化了正向跨语言迁移,同时最小化了干扰。我们将其扩展到一个持续学习框架COMPASS-ECDA,该框架监控生产中的数据分布偏移,并动态更新适配器以防止模型过时,在适应新数据与保留现有知识之间取得平衡。在三种不同的模型架构(Phi-4-Mini、Llama-3.1-8B和Qwen2.5-7B)和多个具有挑战性的多语言基准(Global-MMLU、MMLU-ProX),包括未见过的长上下文任务(OneRuler)上,我们证明COMPASS始终优于基于语言相似性的基线方法,为在动态环境中开发和维护高性能多语言模型提供了一种有效、高效且可持续的解决方案。

关键词

引用

@article{arxiv.2604.20720,
  title  = {COMPASS: COntinual Multilingual PEFT with Adaptive Semantic Sampling},
  author = {Noah Flynn},
  journal= {arXiv preprint arXiv:2604.20720},
  year   = {2026}
}