中文

面向人机科学理解基准的路线图

人工智能 2024-05-07 v2 计算与语言 人机交互 高能物理 - 唯象学 物理学史与哲学

摘要

科学理解是科学的基本目标,使我们能够解释世界。目前尚无良好方法来衡量智能体(无论人类还是人工智能系统)的科学理解水平。缺乏清晰的基准,便难以评估和比较科学理解的不同层次与方法。在本路线图中,我们提出一个利用科学哲学工具创建科学理解基准的框架。我们采用一种行为主义概念,依此真正的理解应被认可为执行特定任务的能力。我们扩展该概念,考虑一组可衡量不同层次科学理解的问题,涵盖信息检索、组织信息以产生解释的能力,以及推断不同情形下事物将如何变化的能力。由这组测试构成的科学理解基准(SUB)允许对不同方法进行评估与比较。基准测试在建立信任、确保质量控制和提供性能评估基础方面发挥着关键作用。通过使机器与人类科学理解相对齐,我们可以提升其效用,最终推进科学理解并助力在机器中发现新见解。

关键词

引用

@article{arxiv.2304.10327,
  title  = {Towards a Benchmark for Scientific Understanding in Humans and Machines},
  author = {Kristian Gonzalez Barman and Sascha Caron and Tom Claassen and Henk de Regt},
  journal= {arXiv preprint arXiv:2304.10327},
  year   = {2024}
}