CASE:基于扩展答案空间的常识增强评分
计算与语言
2023-11-06 v1
摘要
得益于训练中所习得的知识,大语言模型(LLM)在 NLP 任务上展现出了令人印象深刻的零样本性能。在多项选择问答任务中,语言模型概率被用作衡量各答案选项合理性的一种不完美指标。基础评分的主要局限之一在于它将所有词视为同等重要。我们提出了 CASE,一种基于扩展答案空间的常识增强评分(Commonsense-Augmented Score with an Expanded Answer Space)。CASE 通过依据各词与输入中其他词的语义关系为其分配重要性权重,从而解决该局限。这种动态加权方法优于基础 LM 评分,不仅因为它降低了来自不重要词的噪声,还因为它向模型传达了可能有助于回答问题的隐式常识知识。随后我们亦遵循先前工作,通过生成与候选项在概念上相似但词汇上相异的答案来扩展答案空间。当与答案空间扩展相结合时,我们的方法在 5 个常识基准上优于强基线。我们进一步表明这两种方法是互补的,并且在使用较小的 LM 时可能尤为有益。
引用
@article{arxiv.2311.01684,
title = {CASE: Commonsense-Augmented Score with an Expanded Answer Space},
author = {Wenkai Chen and Sahithya Ravi and Vered Shwartz},
journal= {arXiv preprint arXiv:2311.01684},
year = {2023}
}
备注
Findings of EMNLP 2023