Abstract2Appendix:学术评论增强LLM长上下文能力
计算与语言
2024-11-11 v1 人工智能
摘要
大型语言模型(LLMs)在各种任务中展现出显著性能,但其处理长上下文阅读的能力仍然具有挑战性。本研究探讨了利用高质量学术同行评审数据微调LLM以增强其长上下文能力的有效性。我们比较了直接偏好优化(Direct Preference Optimization, DPO)方法与监督微调(Supervised Fine-Tuning, SFT)方法,证明了DPO的优越性和数据效率。实验表明,仅使用2000个样本,微调后的模型在phi-3基础上取得了4.04点的提升,在Qasper基准测试上取得了2.6%的增长。尽管面临数据规模和计算成本的限制,本研究强调了DPO和高质量数据在提升LLM性能方面的潜力。此外,零样本(zero-shot)基准测试结果表明,聚合的高质量人类评论比LLM生成的回复更受青睐,即使对于GPT-4o等最强大的模型也是如此。这表明高质量的人类评论在信息、推理和长上下文检索方面极其丰富,而这些能力即使是最先进的模型也尚未完全捕捉。这些发现强调了利用人类评论进一步推动该领域发展的高价值。
引用
@article{arxiv.2411.05232,
title = {Abstract2Appendix: Academic Reviews Enhance LLM Long-Context Capabilities},
author = {Shengzhi Li and Kittipat Kampa and Rongyu Lin and Bohang Li and Shichao Pei},
journal= {arXiv preprint arXiv:2411.05232},
year = {2024}
}
备注
We share our latest dataset on https://github.com/findalexli/Abstract2Appendix