科学的外星空间:抽样认知不可达的研究方向
人工智能
2026-05-19 v2 机器学习
摘要
科学发现不仅受制于什么是真实的事实,还受制于当前探索领域的研究者所能获得的认知资源。许多方向在现有文献结构下是连贯的,却不太可能被提出,因为没有任何现有社区拥有正确概念、方法和直觉的组合。现代语言模型继承了这一偏见,当被要求生成新想法时,会重组文献中高密度区域。我们引入一个框架,针对该补充区域进行抽样,我们称之为科学的外星空间,在此空间中,方向在现有知识结构下是合理的,但在现有研究者分布下不太可能出现。我们的 метод首先将论文分解为粗粒度概念单元并聚类为共享词汇表中的 idea 原子,然后学习两个互补模型。一个连贯性模型评分判断概念组合是否形成可行的研究方向,一个可用性模型评分是否存在现有作者社区能够产生给定组合。抽样外星方向即转化为对最大化连贯性、最小化可用性的概念组合进行排序。在16,068篇来自NeurIPS、ICLR、ICML及主要NLP会议的同行评审论文语料库上,该抽样器探索的有效概念词汇比前沿LLM ideation baseline宽5-7倍,同时不牺牲连贯性,并在盲LLM、人类和下游实验评估中产生与或优于baseline的想法。通过将科学可行性与社区可用性分离,我们的框架指向AI ideation以补充而非仅加速人类科学,拓展探索到当前社区可能忽视的连贯方向。
引用
@article{arxiv.2603.01092,
title = {The Alien Space of Science: Sampling Coherent but Cognitively Unavailable Research Directions},
author = {Alejandro H. Artiles and Martin Weiss and Levin Brinkmann and Iyad Rahwan and Bernhard Schölkopf and Christopher Pal and Hugo Larochelle and Anirudh Goyal and Nasim Rahaman},
journal= {arXiv preprint arXiv:2603.01092},
year = {2026}
}
备注
10 main pages, 42 appendix pages, 29 figures