大型语言模型中的讽刺检测是否是逐步推理过程?
计算与语言
2024-08-27 v2
摘要
elaborate a series of intermediate reasoning steps can显著提高大型语言模型(LLM)解决复杂问题的能力,因为此类步骤会促使LLM顺序性思考。然而,人类讽刺理解通常被认为是一种直观的整体认知过程,在该过程中整合了各种语言、上下文和情感线索,以形成综合性的理解,可能不遵循逐步的方式。为验证这一论点的有效性,我们引入了新的提示框架(称为SarcasmCue),包含四个子方法,即矛盾链(CoC)、线索图(GoC)、线索包袱(BoC)和线索张量(ToC),这些方法会促使LLM通过考虑顺序和非顺序提示方法来检测人类讽刺。通过对四个基准进行全面经验比较,我们突出了三个关键发现:(1)CoC 和 GoC 在更高级的模型(如GPT-4和Claude 3.5)上表现优异,提升了3.5%。(2)ToC 在评估较小的LLM时显著优于其他方法,使F1分数提高了29.7%。(3)我们提出的框架在四个数据集上的F1分数分别推高了SOTA(即ToT)的4.2%、2.0%、29.7%和58.2%,这表明了该框架的有效性和稳定性。
关键词
引用
@article{arxiv.2407.12725,
title = {Is Sarcasm Detection A Step-by-Step Reasoning Process in Large Language Models?},
author = {Ben Yao and Yazhou Zhang and Qiuchi Li and Jing Qin},
journal= {arXiv preprint arXiv:2407.12725},
year = {2024}
}
备注
9 pages, 5 figures