AI科学家的“图灵测试”
人工智能
2024-05-24 v1
摘要
虽然LLM在解决数学或编码问题方面表现出了令人印象深刻的能力,但做出科学发现的能力仍然是一个独特的挑战。本文提出了一个“AI科学家的图灵测试”,以评估AI代理是否能够独立进行科学研究,而不依赖人类生成的知识。从科学发展的历史中汲取灵感,我们提出了七个基准测试,评估AI代理在各个科学领域做出突破性发现的能力。这些测试包括:从天体观测中推断日心模型,在模拟环境中发现运动定律,推导振动弦的微分方程,从电动力学模拟中推断麦克斯韦方程组,发明初值问题的数值方法,发现用于数据压缩的霍夫曼编码,以及开发高效的排序算法。为了确保这些测试的有效性,AI代理被提供每个问题特定的交互式库或数据集,而不访问可能包含目标发现信息的人类知识。最终目标是创建一个能够做出新颖且有影响力的科学发现的AI科学家,超越各自领域中最优秀的人类专家。这些“图灵测试”作为中间里程碑,评估AI代理做出在当时具有突破性发现的能力。如果AI代理能够通过这七个测试中的大多数,将表明在构建AI科学家方面取得了重大进展,为自主科学发现的未来进步铺平道路。本文旨在为AI在科学研究中的能力建立一个基准,并激发这一激动人心领域的进一步研究。
引用
@article{arxiv.2405.13352,
title = {"Turing Tests" For An AI Scientist},
author = {Xiaoxin Yin},
journal= {arXiv preprint arXiv:2405.13352},
year = {2024}
}