CARMA:通过高级正则化与互信息对齐增强LLM中的组合性
计算与语言
2025-05-21 v2
摘要
大型语言模型(LLM)在组合泛化方面存在困难,这限制了其系统性地组合已学组件以解释新颖输入的能力。尽管架构修改、微调和数据增强可以改善组合性,但它们通常适应性有限、面临可扩展性约束,或在真实数据上收益递减。为解决这一问题,我们提出了CARMA,一种在保持微调性能的同时增强LLM中组合推理稳定性与鲁棒性的干预方法。CARMA采用互信息正则化与逐层稳定性约束来缓解特征碎片化,确保结构化表示在层间和层内持续存在。我们在逆词典建模和情感分类任务上评估了CARMA,测量其对语义一致性、性能稳定性以及对词汇扰动的鲁棒性的影响。结果表明,CARMA降低了微调引入的变异性,稳定了token表示,并改善了组合推理。虽然其有效性因架构而异,但CARMA的核心优势在于强化已学结构而非引入新能力,使其成为一种可扩展的辅助方法。这些发现表明,将CARMA与微调相结合,可以在保持任务特定性能的同时改善LLM的组合泛化能力。
引用
@article{arxiv.2502.11066,
title = {CARMA: Enhanced Compositionality in LLMs via Advanced Regularisation and Mutual Information Alignment},
author = {Nura Aljaafari and Danilo S. Carvalho and André Freitas},
journal= {arXiv preprint arXiv:2502.11066},
year = {2025}
}
备注
19 pages, 8 figures, 8 tables