面向文献综述的层次化目录生成:一个基准
计算与语言
2023-11-20 v3
摘要
科学文献综述生成旨在从大量参考论文中提取并组织重要信息,进而生成相应的综述,但往往缺乏清晰且合乎逻辑的结构层次。我们观察到,高质量的目录引导生成过程能有效缓解该问题。因此,我们提出了一个基础且具有挑战性的任务——面向文献综述的层次化目录生成,作为综述生成的第一步,其目标是给定若干参考文献,生成综述论文的层次化目录。我们构建了一个新颖的英文文献综述层次化目录数据集,包含7.6k个文献综述目录和389k篇参考论文。为准确评估模型性能,我们设计了从语义和结构两个维度衡量信息量和与真值相似度的两种评价指标。我们的详尽分析验证了数据集的高质量及评价指标的有效性。我们进一步在BART等最先进的摘要模型和ChatGPT等大型语言模型上进行了多样化基准实验以评估其能力。我们进一步讨论了该任务的潜在研究方向以激励未来研究。
引用
@article{arxiv.2304.03512,
title = {Hierarchical Catalogue Generation for Literature Review: A Benchmark},
author = {Kun Zhu and Xiaocheng Feng and Xiachong Feng and Yingsheng Wu and Bing Qin},
journal= {arXiv preprint arXiv:2304.03512},
year = {2023}
}
备注
EMNLP 2023 findings