中文

IntentGrasp:一个全面的意图理解基准

计算与语言 2026-05-11 v1 人工智能 机器学习

摘要

准确理解语音、对话和写作背后的意图对于开发有用的大型语言模型(LLM)助手至关重要。本文介绍了 IntentGrasp,一个用于评估 LLM 意图理解能力的全面基准。IntentGrasp 源自涵盖 12 个不同领域的 49 个高质量、开放许可的语料库,通过源数据集整理、意图标签语境化和任务格式统一构建而成。IntentGrasp 包含一个包含 262,759 个实例的大规模训练集和两个评估集:一个包含 12,909 个测试用例的 All Set 和一个更平衡、更具挑战性的包含 470 个用例的 Gem Set。对 7 个系列共 20 个 LLM(包括 GPT-5.4、Gemini-3.1-Pro 和 Claude-Opus-4.7 等前沿模型)的广泛评估表明,其表现不尽如人意,在 All Set 上得分低于 60%,在 Gem Set 上得分低于 25%。值得注意的是,20 个测试模型中有 17 个在 Gem Set 上的表现不如随机猜测基线(15.2%),而估计的人类表现为 ~81.1%,表明仍有巨大的改进空间。为了增强这种能力,本文提出了意图微调(IFT),在 IntentGrasp 的训练集上微调模型,在 All Set 上获得了 30+ F1 分数的显著提升,在 Gem Set 上获得了 20+ 分数的提升。值得注意的是,留一领域交叉验证实验进一步证明了 IFT 强大的跨领域泛化能力,验证了它是一种大幅增强 LLM 意图理解能力的有前景的方法。总体而言,通过对意图理解能力进行基准测试和提升,本研究为迈向更有意图、更强大、更安全且造福人类和社会的 AI 助手指明了一条有前景的道路。

关键词

引用

@article{arxiv.2605.06832,
  title  = {IntentGrasp: A Comprehensive Benchmark for Intent Understanding},
  author = {Yuwei Yin and Chuyuan Li and Giuseppe Carenini},
  journal= {arXiv preprint arXiv:2605.06832},
  year   = {2026}
}

备注

IntentGrasp data is available on [Hugging Face](https://huggingface.co/datasets/yuweiyin/IntentGrasp), and the code is released on [GitHub](https://github.com/YuweiYin/IntentGrasp)