用于评估基于 LLM 的研究问题提取任务函数的数据集
计算与语言
2024-09-12 v1 人工智能
机器学习
摘要
文本摘要技术的进展令人瞩目。然而,准确地从高度专业的文档(如研究论文)中提取和摘要必要信息的任务尚未得到充分调查。我们聚焦于从研究论文中提取研究问题 (RQ) 的任务,并构建了一个新数据集,包含机器学习论文、由 GPT-4 提取的 RQ 以及来自多个角度的人类评估。使用该数据集,我们系统比较了最近提出的基于 LLM 的摘要评估函数,发现这些函数与人类评估之间的相关性不足。我们期望该数据集为进一步研究开发针对 RQ 提取任务的更好评估函数提供基础,并推动该任务的性能提升。该数据集已发布于 https://github.com/auto-res/PaperRQ-HumanAnno-Dataset。
引用
@article{arxiv.2409.06883,
title = {A Dataset for Evaluating LLM-based Evaluation Functions for Research Question Extraction Task},
author = {Yuya Fujisaki and Shiro Takagi and Hideki Asoh and Wataru Kumagai},
journal= {arXiv preprint arXiv:2409.06883},
year = {2024}
}