从表层模式到语义理解:在对比集上微调语言模型
计算与语言
2025-01-09 v2 人工智能
摘要
大规模预训练语言模型在自然语言推理(NLI)任务的标准数据集上表现出色。遗憾的是,这些评估可能具有误导性,因为尽管模型能在分布内数据上表现良好,但在分布外测试集(如对比集)上表现不佳。对比集由对输入进行极微小但有意义的修改并改变其金标签的数据扰动实例组成,揭示了模型如何学习训练数据中的表层模式,而非学习更复杂的语言细微差别。例如,ELECTRA-small 语言模型在 SNLI 数据集上达到了近 90% 的准确率,但在分布外对比集上测试时降至 75%。本研究探讨如何通过在训练期间让语言模型接触少量更复杂的对比集来提升其鲁棒性,以帮助其更好地学习语言模式。采用该方法后,模型恢复了性能并在对比集上达到了近 90% 的准确率,凸显了多样且具挑战性的训练数据的重要性。
引用
@article{arxiv.2501.02683,
title = {From Superficial Patterns to Semantic Understanding: Fine-Tuning Language Models on Contrast Sets},
author = {Daniel Petrov},
journal= {arXiv preprint arXiv:2501.02683},
year = {2025}
}