中文

指令意图探测:大语言模型指令理解的全面评估

人工智能 2025-01-24 v2

摘要

大语言模型 (LLM) 一个关键优势是通过生成适当的响应与人类交互。这种能力被称为指令跟随能力,已为 LLMs 在various 领域的应用奠定基础,亦是评估其性能的关键指标。虽然已开发诸多评估基准,但大多聚焦于清晰连贯的指令。然而,我们注意到 LLM 容易被指令格式化语句所干扰,可能忽略其指令理解能力。为此,我们提出 Intention of Instruction (IoInst) 基准。该基准评估 LLM 在不被外部指令误导时保持专注并理解指令的能力。其主要目标是识别准确引导给定上下文生成的合适指令。我们的发现表明,即便是最新引入的 SOTA 模型仍缺乏指令理解能力。本研究提出 IoInst 的同时,我们还对若干可能用于 IoInst 的策略进行广泛分析。

关键词

引用

@article{arxiv.2412.19450,
  title  = {Find the Intention of Instruction: Comprehensive Evaluation of Instruction Understanding for Large Language Models},
  author = {Hyeonseok Moon and Jaehyung Seo and Seungyoon Lee and Chanjun Park and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2412.19450},
  year   = {2025}
}

备注

NAACL25-Findings