面向自回归生成模型文献的可复现、可扩展管道
信息检索
2025-08-07 v1 数字图书馆
机器学习
摘要
自回归生成模型研究的快速推进导致论文数量激增,手动文献调查和复现研究变得日益不实用。我们提出了一个完全开源、可复现的管道,自动从公共存储库检索候选文档、筛选相关性、提取元数据、超参数与报告结果、聚类主题、生成检索增强摘要,并生成容器化脚本以复现选定实验。在50篇手动标注的论文上进行定量评估,相关性分类、超参数提取和引文识别的F1分数均超过0.85。对最多1000篇论文的实验表明,采用8个CPU工作线程可实现近线性可扩展性。三个案例研究——AWD-LSTM在WikiText-2上、Transformer-XL在WikiText-103上以及自回归音乐模型在Lakh MIDI数据集上——均确认提取的设置支持忠实复现,测试困惑度在原始报告的1%至3%范围内。
引用
@article{arxiv.2508.04612,
title = {A Reproducible, Scalable Pipeline for Synthesizing Autoregressive Model Literature},
author = {Faruk Alpay and Bugra Kilictas and Hamdi Alakkad},
journal= {arXiv preprint arXiv:2508.04612},
year = {2025}
}
备注
9 pages