中文

InnoEval:将科学想法评估视为一种知识 grounding、多视角推理问题

计算与语言 2026-02-17 v1 人工智能 信息检索 机器学习

摘要

大型语言模型的快速演进催生了科学想法的大量产出,但这一飞跃并未伴随想法评估能力的同步提升。科学评估的本质要求具备知识 grounding、集体 deliberation 以及多标准 decision-making。然而,现有的想法评估方法常常受限于知识视野狭窄、评估维度被压平,以及 LLM-as-a-Judge 内在偏见。为此,我们将想法评估建模为知识 grounding、多视角推理问题,提出 InnoEval——一种旨在模拟人类水平想法评估的深度创新评估框架。我们引入异构深度知识检索引擎,从多样化的在线信息源中检索并 grounding 动态证据。进一步构建包含背景学科各异 reviewers 的创新评审委员会,实现多维度解耦式评估。我们基于权威同行评审提交材料构建了完整数据集,用于基准测试 InnoEval。实验表明,InnoEval 在点评、配对评估和组评任务中均稳居上风,评判模式与共识高度符合人类专家。

关键词

引用

@article{arxiv.2602.14367,
  title  = {InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem},
  author = {Shuofei Qiao and Yunxiang Wei and Xuehai Wang and Bin Wu and Boyang Xue and Ningyu Zhang and Hossein A. Rahmani and Yanshan Wang and Qiang Zhang and Keyan Ding and Jeff Z. Pan and Huajun Chen and Emine Yilmaz},
  journal= {arXiv preprint arXiv:2602.14367},
  year   = {2026}
}

备注

Ongoing Work