中文

面向常识陈述估计的反事实样本构建与训练

计算与语言 2024-12-31 v1

摘要

合理性估计(PE)对于语言模型客观理解现实世界至关重要。大语言模型(LLMs)在PE任务中表现出色,但由于常识知识的复杂性,有时会产生琐碎的常识错误。它们缺乏理想PE模型的两个关键特征:a) 语言可解释性:依赖关键词语段进行决策;b) 常识敏感性:检测常识中微妙的语言变化。为解决这些问题,我们提出一种新的模型无关方法,称为常识反事实样本生成(CCSG)。通过使用CCSG训练PE模型,我们鼓励它们关注关键词语,从而增强语言可解释性和常识敏感性。具体来说,CCSG通过策略性地替换关键词和在句子中引入低水平dropout来生成反事实样本。然后将这些反事实样本纳入句子级对比训练框架,进一步增强模型的学习过程。在九个不同数据集上的实验结果表明,CCSG在解决常识推理挑战方面的有效性,我们的CCSG方法相比SOTA方法提高了3.07%。

关键词

引用

@article{arxiv.2412.20563,
  title  = {Counterfactual Samples Constructing and Training for Commonsense Statements Estimation},
  author = {Chong Liu and Zaiwen Feng and Lin Liu and Zhenyun Deng and Jiuyong Li and Ruifang Zhai and Debo Cheng and Li Qin},
  journal= {arXiv preprint arXiv:2412.20563},
  year   = {2024}
}

备注

14 pages, 4 figures