通过因果感知后训练缓解大语言模型中的虚假相关性
机器学习
2025-06-12 v1
摘要
尽管大语言模型(LLMs)在语言建模中展现了显著能力,但近期研究表明它们常因预训练中习得的虚假相关性而在分布外(OOD)样本上失败。在此,我们旨在通过因果感知后训练(CAPT)缓解此类虚假相关性。通过将偏差预测分解为两个无偏步骤——即事件估计(event estimation)和事件干预(event intervention),我们在不引入额外微调偏差的情况下减少了LLMs的预训练偏差,从而增强了模型的泛化能力。在形式因果推理基准CLadder和逻辑推理数据集PrOntoQA上的实验表明,采用CAPT微调的3B规模语言模型仅使用100个ID微调样本即可在ID和OOD任务上同时超越传统SFT和更大规模的LLMs,证明了CAPT的有效性和样本效率。
引用
@article{arxiv.2506.09433,
title = {Mitigating Spurious Correlations in LLMs via Causality-Aware Post-Training},
author = {Shurui Gui and Shuiwang Ji},
journal= {arXiv preprint arXiv:2506.09433},
year = {2025}
}