中文

探索最新的大语言模型用于 leaderboard 提取

计算与语言 2024-07-10 v2 人工智能

摘要

大语言模型 (Large Language Models, LLMs) 的快速发展为自动化 AI 研究中的复杂任务开辟了新的途径。本文研究了不同 LLMs (Mistral 7B、Llama-2、GPT-4-Turbo 和 GPT-4.o) 从实证 AI 研究文章中提取 leaderboard 信息的效能。我们探索了三种类型的上下文输入:DocTAET (文档标题、摘要、实验设置和表格信息)、DocREC (结果、实验和结论) 以及 DocFULL (整个文档)。我们的全面研究评估了这些模型从研究论文中生成 (任务、数据集、指标、得分) 四元组的性能。我们的发现揭示了每个模型和每种上下文类型的优势与局限性,为未来 AI 研究自动化 efforts 提供了宝贵的指导。

关键词

引用

@article{arxiv.2406.04383,
  title  = {Exploring the Latest LLMs for Leaderboard Extraction},
  author = {Salomon Kabongo and Jennifer D'Souza and Sören Auer},
  journal= {arXiv preprint arXiv:2406.04383},
  year   = {2024}
}