中文

LPFQA:基于长尾专业论坛的 LLM 评估基准

人工智能 2026-01-09 v2 计算与语言

摘要

大语言模型(LLM)在标准推理和问答基准测试中表现良好,但此类评估往往无法捕捉其处理长尾、专业知识密集型任务的能力。我们提出了 LPFQA,这是一个源自真实专业论坛讨论的长尾知识基准,覆盖 7 个学术和工业领域,包含 430 个精选任务,基于实际专业知识。LPFQA 评估专业推理、领域术语理解和语境解释能力,采用分层难度结构以确保语义清晰和唯一可识别答案。在多个主流 LLM 上进行实验,揭示了显著的性能差距,尤其是在需要深层领域推理的任务上,暴露了现有基准忽视的局限性。总体而言,LPFQA 提供了一个真实且具辨识力的评估框架,补充了先前的基准,并为未来 LLM 开发指明了方向。

关键词

引用

@article{arxiv.2511.06346,
  title  = {LPFQA: A Long-Tail Professional Forum-based Benchmark for LLM Evaluation},
  author = {Liya Zhu and Peizhuang Cong and Jingzhe Ding and Aowei Ji and Wenya Wu and Jiani Hou and Chunjie Wu and Xiang Gao and Jingkai Liu and Zhou Huan and Xuelei Sun and Yang Yang and Jianpeng Jiao and Liang Hu and Xinjie Chen and Jiashuo Liu and Tong Yang and Zaiyuan Wang and Ge Zhang and Wenhao Huang},
  journal= {arXiv preprint arXiv:2511.06346},
  year   = {2026}
}