中文

大语言模型能否遵循概念标注指南?一项科学与金融领域的案例研究

计算与语言 2024-06-28 v2 人工智能

摘要

尽管大语言模型(LLMs)展现出利用上下文演示的卓越能力,但它们在多大程度上能从真值标签中学习新概念或事实仍不清楚。为解答此问题,我们考察了指令微调 LLMs 遵循上下文概念指南进行句子标注任务的能力。我们设计了呈现不同类型事实与反事实概念定义的指南,将其用作零样本句子分类任务的提示。我们的结果表明,尽管概念定义始终有助于任务表现,但只有较大模型(具有 70B 参数或更多)在反事实语境下具有有限能力。重要的是,只有如 GPT-3.5 和 GPT-4 之类的专有模型能识别荒谬的指南,我们推测这是由于更精细的对齐方法。最后,我们发现 Falcon-180B-chat 在大多数情况下逊于 Llama-2-70B-chat,这表明精细的微调比增大模型规模更有效。总之,我们简单的评估方法揭示了最具能力的开源语言模型与领先专有 API 之间在概念理解上的显著差距。

关键词

引用

@article{arxiv.2311.08704,
  title  = {Can Large Language Models Follow Concept Annotation Guidelines? A Case Study on Scientific and Financial Domains},
  author = {Marcio Fonseca and Shay B. Cohen},
  journal= {arXiv preprint arXiv:2311.08704},
  year   = {2024}
}

备注

ACL 2024 camera ready