中文

LDC:动态控制下的研究想法生成学习

计算与语言 2025-11-17 v2 人工智能

摘要

大型语言模型(LLM)的最新进展已证明其在自动化科学研究构思方面的潜力。现有方法主要关注提示技术,常常产生与专家标准不一致的想法——新颖性、可行性和有效性,这被研究界公认为高质量想法的三个关键子维度。此外,由于这些维度固有的权衡,平衡它们仍然具有挑战性。为解决这些局限,我们提出了第一个采用两阶段方法(结合监督微调(SFT)和可控强化学习(RL))的框架。在SFT阶段,模型从研究论文及其相应的后续想法的配对中学习基础模式。在RL阶段,由细粒度反馈引导的多维奖励模型评估并优化模型的关键维度。在推理过程中,由句子级解码器协调的维度控制器能够实现想法生成过程的动态上下文感知引导。我们的框架为研究想法生成提供了一种平衡的方法,通过动态导航新颖性、可行性和有效性之间的权衡,在实验中实现了高质量的结果。

关键词

引用

@article{arxiv.2412.14626,
  title  = {LDC: Learning to Generate Research Idea with Dynamic Control},
  author = {Ruochen Li and Liqiang Jing and Chi Han and Jiawei Zhou and Xinya Du},
  journal= {arXiv preprint arXiv:2412.14626},
  year   = {2025}
}