SCI-IDEA:基于标记和句子嵌入的上下文感知科学构思
计算与语言
2025-03-26 v1 数字图书馆
摘要
每一次科学发现都始于一种灵感,这种灵感源自先行工作、跨学科概念以及新兴挑战。近年来,针对在科学语料库上训练的大型语言模型 (LLM) 的最新进展推动了对 AI 支持构思的兴趣。然而,生成上下文感知的、高质量的、富有创造性的构思仍然具有挑战性。我们引入 SCI-IDEA,一个利用 LLM 提示策略和 Aha Moment 检测进行迭代构思细化的框架。SCI-IDEA 从研究出版物中提取关键要素,评估生成的构思在新颖性、兴奋性、可行性和有效性方面的得分。全面实验验证了 SCI-IDEA 的有效性,在新颖性、兴奋性、可行性和有效性方面的平均得分分别为 6.84、6.86、6.89 和 6.84(满分 10 分)。评估使用了 GPT-4o、GPT-4.5、DeepSeek-32B(每个都在 2-shot 提示下),以及 DeepSeek-70B(3-shot 提示),其中使用标记级别嵌入用于 Aha Moment 检测。类似地,在 GPT-4o 下的 5-shot 提示、GPT-4.5 下的 3-shot 提示、DeepSeek-32B 下的 zero-shot chain-of-thought 提示,以及 DeepSeek-70B 下的 5-shot 提示(使用句子级别嵌入)时,得分分别为 6.87、6.86、6.83 和 6.87。我们也讨论了包括学术信用、潜在滥用以及在人类创造力与 AI 驱动构思之间取得平衡的伦理考虑。我们的结果凸显了 SCI-IDEA 在支持结构化和灵活的上下文感知科学构思探索方面的潜力,既有助于创新,又能保持伦理标准。
引用
@article{arxiv.2503.19257,
title = {SCI-IDEA: Context-Aware Scientific Ideation Using Token and Sentence Embeddings},
author = {Farhana Keya and Gollam Rabby and Prasenjit Mitra and Sahar Vahdati and Sören Auer and Yaser Jaradeh},
journal= {arXiv preprint arXiv:2503.19257},
year = {2025}
}