重新审视大型推理模型的提示优化——以事件抽取为案例研究
计算与语言
2025-10-17 v2
摘要
大型推理模型(LRM),如DeepSeek-R1和OpenAI o1,在各种推理任务中展现了卓越的能力。它们生成和推理中间思维的强大能力也引发了争论,即它们可能不再需要大量的提示工程或优化来解释人类指令并产生准确输出。在这项工作中,我们旨在系统地研究这个开放问题,以结构化任务事件抽取作为案例研究。我们实验了两种LRM(DeepSeek-R1和o1)和两种通用大型语言模型(LLM)(GPT-4o和GPT-4.5),当它们被用作任务模型或提示优化器时。我们的结果表明,在像事件抽取这样复杂的任务上,LRM作为任务模型仍然受益于提示优化,并且使用LRM作为提示优化器会产生更有效的提示。我们的发现也推广到事件抽取之外的任务。最后,我们提供了LRM常见错误的错误分析,并强调了LRM在细化任务指令和事件指南方面的稳定性和一致性。
引用
@article{arxiv.2504.07357,
title = {Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction},
author = {Saurabh Srivastava and Ziyu Yao},
journal= {arXiv preprint arXiv:2504.07357},
year = {2025}
}