中文

大型语言模型中先验知识的强牵引力及其对情绪识别的影响

计算与语言 2025-08-11 v1 人工智能

摘要

上下文学习(ICL)已成为一种强大的范式,用于在不更新模型参数的情况下,利用大型语言模型(LLM)执行自然语言任务,这与传统的基于梯度的微调形成对比。ICL的前景在于,LLM能够以极低的成本,适应并达到具有竞争力或最先进水平的当前任务执行性能。LLM以这种少样本方式执行任务的能力依赖于其关于任务的背景知识(或任务先验)。然而,近期研究发现,与传统学习不同,LLM无法完全整合来自与任务先验相悖的演示中的信息。这可能导致性能饱和在次优水平,尤其对于情绪识别等主观任务,由于人类标注的差异性,文本到情绪的映射可能差异很大。在本工作中,我们设计实验并提出度量方法,以明确量化LLM先验代理的一致性及其对后验的牵引力。我们表明,LLM在情绪识别中具有强但不一致的先验,这些先验固化了其预测。我们还发现,模型越大,这些效应就越强。我们的结果表明,在预训练领域之外的情感中心任务中使用ICL,以及在解释ICL结果时,需要谨慎对待较大的LLM。

关键词

引用

@article{arxiv.2403.17125,
  title  = {The Strong Pull of Prior Knowledge in Large Language Models and Its Impact on Emotion Recognition},
  author = {Georgios Chochlakis and Alexandros Potamianos and Kristina Lerman and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2403.17125},
  year   = {2025}
}

备注

30 pages, 27 figures