中文

大语言模型情感检测性能影响的超参数评估

计算与语言 2025-04-17 v2

摘要

情感检测对人类和机器都具有挑战性。本研究探讨了模型特征如何影响OpenAI的GPT和Meta的Llama-2模型中的情感检测。鉴于这些模型具有强大的自然语言理解能力和广泛流行度,我们在各种模型规模、版本和超参数下评估了微调和零样本模型。在政治和平衡(pol-bal)部分的流行自标注Reddit语料库(SARC2.0)情感数据集上进行实验。在微调场景下,模型规模在同一模型系列内单调提高;此外,超参数调优也会影响性能。在微调情况下,全精度Llama-2-13b实现了达到0.83的准确率和F₁得分,相当于平均人类水平。在零样本设置下,一个GPT-4模型实现了与先前尝试相当的性能,准确率为0.70,F₁得分为0.75。此外,模型性能可能在每个版本后增加或下降,这凸显了在每个版本发布后重新评估性能的必要性。

关键词

引用

@article{arxiv.2504.06166,
  title  = {Assessing how hyperparameters impact Large Language Models' sarcasm detection performance},
  author = {Montgomery Gole and Andriy Miranskyy},
  journal= {arXiv preprint arXiv:2504.06166},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2312.04642