中文

指令调优 vs. 上下文学习:重新审视大型语言模型在少量计算社会科学中的表现

计算与语言 2024-09-24 v1 人工智能

摘要

大型语言模型(LLM)在计算社会科学(CSS)任务中的实际应用主要取决于指令调优(IT)或上下文学习(ICL)的有效性。虽然 IT 在针对各种任务微调 LLM 时显示出高度的有效性,但 ICL 通过无需显式梯度更新的方式从示例中学习,提供了快速的任务适应方案。本文评估了在少量 CSS 任务中使用 IT 与 ICL 对 LLM 分类性能的影响。实验结果表明,在大多数 CSS 任务中,ICL 均一致优于 IT。此外,我们还研究了训练样本数量增加与 LLM 性能之间的关系。我们的发现表明,仅增加样本数量而不考虑其质量,并不能稳定地提升 LLM 在 ICL 或 IT 方面的性能,甚至可能导致性能下降。最后,我们比较了三种提示策略,证明 ICL 在零样本和链式思考(CoT)方面更为有效。我们的研究凸显了 ICL 在少量样本设置下处理 CSS 任务中的显著优势,强调了优化样本质量和提示策略以提升 LLM 分类性能的重要性。代码将公开提供。

关键词

引用

@article{arxiv.2409.14673,
  title  = {Instruction Tuning Vs. In-Context Learning: Revisiting Large Language Models in Few-Shot Computational Social Science},
  author = {Taihang Wang and Xiaoman Xu and Yimin Wang and Ye Jiang},
  journal= {arXiv preprint arXiv:2409.14673},
  year   = {2024}
}