中文

聊天机器人:细微的提示词变更如何导致情感分类的重大差异

计算与语言 2025-04-17 v1 人工智能

摘要

当今社会科学的根本问题之一是:我们可以对像ChatGPT这样高度复杂的预测模型信任多少?本研究检验了细微变更提示词结构是否不会显著影响大语言模型GPT-4o mini生成的情感极性分析分类结果的假设。该研究使用包含10万条拉美四个总统评论的 数据集,对模型进行10次分类,每一次略微变更提示词。实验方法包括探索性和确认性分析,以识别分类之间显著差异。结果显示,即使对提示词进行微小修改(如词汇、句法或模态变化,或缺乏结构),也会影响分类结果。在某些情况下,模型会产生不一致的响应,如混合类别、提供无关解释或使用除西班牙语之外的语言。使用卡方检验统计分析确认,大多数提示词之间的比较都存在显著差异,仅在语言结构高度相似的案例中例外。这些发现挑战了大型语言模型在分类任务中的鲁棒性和可信度,凸显其对指令变更的脆弱性。此外,发现缺乏结构化语法的提示词会增加幻觉发生频率。讨论进一步强调,大型语言模型的可信度不仅基于技术性能,还取决于其使用的社会和制度关系。

关键词

引用

@article{arxiv.2504.12180,
  title  = {Trusting CHATGPT: how minor tweaks in the prompts lead to major differences in sentiment classification},
  author = {Jaime E. Cuellar and Oscar Moreno-Martinez and Paula Sofia Torres-Rodriguez and Jaime Andres Pavlich-Mariscal and Andres Felipe Mican-Castiblanco and Juan Guillermo Torres-Hurtado},
  journal= {arXiv preprint arXiv:2504.12180},
  year   = {2025}
}

备注

in Spanish language