通过 LLM 生成的对比集增强 NLP 鲁棒性与泛化能力:面向系统评估与对抗训练的可扩展框架
计算与语言
2025-03-11 v1 人工智能
机器学习
摘要
标准 NLP 基准测试通常无法捕捉由数据集伪影和虚假相关性引起的脆弱性。对比集通过在决策边界附近挑战模型来解决这一差距,但传统上其创建过程劳动强度大且多样性有限。本研究利用大型语言模型自动生成多样化的对比集。使用 SNLI 数据集,我们创建了一个包含 3,000 个示例的对比集来评估和提升模型鲁棒性。在这些对比集上进行微调增强了在系统性扰动示例上的性能,维持了标准测试准确率,并适度提高了对新颖扰动的泛化能力。这种自动化方法为评估和改进 NLP 模型提供了可扩展的解决方案,解决了系统性泛化挑战,并推进了在真实世界应用中的鲁棒性。
引用
@article{arxiv.2503.06648,
title = {Enhancing NLP Robustness and Generalization through LLM-Generated Contrast Sets: A Scalable Framework for Systematic Evaluation and Adversarial Training},
author = {Hender Lin},
journal= {arXiv preprint arXiv:2503.06648},
year = {2025}
}