大语言模型在日语文本分类任务中对提示模板的敏感性与鲁棒性
计算与语言
2023-06-09 v2 人工智能
摘要
近年来,受预训练语言模型与大语言模型(LLM)进展的推动,提示工程相关研究显著增多。然而,该领域内已发现一个关键问题:这些模型对提示模板(Prompt Template)的敏感性与鲁棒性不足,尤其在日语等较少被研究的语言中。本文通过对若干代表性大语言模型(LLM)与一个广泛使用的预训练模型(PLM)的全面评估来探讨此问题。这些模型使用日语基准数据集进行细致考察,旨在评估并分析当前多语言模型在此语境下的表现。我们的实验结果显示出惊人的差异。提示模板中句子结构的简单改动导致 GPT-4 的准确率从 49.21 急剧下降至 25.44。该观察强调,即便高性能的 GPT-4 模型在处理多样化日语提示模板时也遭遇显著的稳定性问题,令模型输出结果的一致性存疑。鉴于这些发现,我们最后提出潜在的研究方向,以进一步提升现阶段大语言模型的发展与性能。
引用
@article{arxiv.2305.08714,
title = {Sensitivity and Robustness of Large Language Models to Prompt Template in Japanese Text Classification Tasks},
author = {Chengguang Gan and Tatsunori Mori},
journal= {arXiv preprint arXiv:2305.08714},
year = {2023}
}
备注
Under Review. 11 pages, 8 figures