中文

LongEval:通过基于计划的范式对长文本生成进行全面分析

计算与语言 2025-03-10 v2

摘要

大型语言模型(LLM)在各种自然语言处理任务中取得了显著成功,但其生成长文本的能力仍不被充分理解和评估。我们的分析表明,当前的LLM在长文本生成中难以满足长度要求和信息密度,随文本长度增加性能会恶化。为定量定位这种性能下降并提供模型开发的进一步见解,我们提出LongEval,通过直接和基于计划的生成范式评估长文本生成,受认知和语言写作模型的启发。本工作的全面实验揭示了有趣的发现,例如尽管模型规模与生成能力相关,但小规模模型(如LongWriter)通过在长文本上充分训练,性能可与之相当。所有代码和数据集已发布于https://github.com/Wusiwei0410/LongEval。

关键词

引用

@article{arxiv.2502.19103,
  title  = {LongEval: A Comprehensive Analysis of Long-Text Generation Through a Plan-based Paradigm},
  author = {Siwei Wu and Yizhi Li and Xingwei Qu and Rishi Ravikumar and Yucheng Li and Tyler Loakman and Shanghaoran Quan and Xiaoyong Wei and Riza Batista-Navarro and Chenghua Lin},
  journal= {arXiv preprint arXiv:2502.19103},
  year   = {2025}
}

备注

Under review