通过多源动态逻辑融合实现低资源语言高效适配
计算与语言
2026-04-21 v1
摘要
将大语言模型(LLM)适配低资源语言(LRL)受限于稀缺的任务数据和计算资源。尽管 Proxy Tuning 提出了一种基于逻辑水平的引入规模效应的策略,但在 LRL 场景下往往失败,因为大模型的较弱 LRL 能力可能压倒专门小模型的知识。因此,我们提出了 TriMix,一个基于测试时逻辑融合的框架,通过动态平衡来自三个不同来源的能力:来自不断预训练小模型的 LRL 能力、来自高资源语言指令微调的任务能力,以及大模型的规模效应。该方法既数据高效又计算高效,无需 LRL 任务标注,仅需在小模型上进行持续预训练。跨越四个模型家族和八种 LRL 的实验表明,TriMix 在所有情况下都一致优于单模型基线和 Proxy Tuning。我们的分析揭示了,优先采用小型 LRL 专用模型的逻辑对于成功至关重要,这挑战了普遍的以大模型为主的假设。
引用
@article{arxiv.2604.18106,
title = {Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion},
author = {Chen Zhang and Jiuheng Lin and Zhiyuan Liao and Yansong Feng},
journal= {arXiv preprint arXiv:2604.18106},
year = {2026}
}
备注
ACL 2026