中文

通过 LLM 生成的反事实样本和动态平衡抽样消除 NLI 中的假关联

计算与语言 2025-12-23 v1 人工智能 机器学习

摘要

自然语言推理 (NLI) 模型常常依赖于虚假关联而非语义推理。现有的缓解策略往往需要高额标注成本,或在微调过程中引发灾难性遗忘。我们提出了一个自动化、可扩展的管道以应对这些限制。首先,我们引入 Log-Frequency LMI (LF-LMI) 以准确检测语义制件。其次,我们通过带多 judges 验证的 LLM 生成管道生成高质量的合成对抗集。最后,我们引入动态平衡抽样,这是一种训练策略,通过旋转原始数据分布以防止遗忘。我们的方法在一个具有挑战性的基准上将一致性提高到 81.0%,同时保持 88.4% 的原位准确率,显著优于简单微调。

关键词

引用

@article{arxiv.2512.18462,
  title  = {Mitigating Spurious Correlations in NLI via LLM-Synthesized Counterfactuals and Dynamic Balanced Sampling},
  author = {Christopher Román Jaimes},
  journal= {arXiv preprint arXiv:2512.18462},
  year   = {2025}
}