面向人机科学理解基准的路线图
人工智能
2024-05-07 v2 计算与语言
人机交互
高能物理 - 唯象学
物理学史与哲学
摘要
科学理解是科学的基本目标,使我们能够解释世界。目前尚无良好方法来衡量智能体(无论人类还是人工智能系统)的科学理解水平。缺乏清晰的基准,便难以评估和比较科学理解的不同层次与方法。在本路线图中,我们提出一个利用科学哲学工具创建科学理解基准的框架。我们采用一种行为主义概念,依此真正的理解应被认可为执行特定任务的能力。我们扩展该概念,考虑一组可衡量不同层次科学理解的问题,涵盖信息检索、组织信息以产生解释的能力,以及推断不同情形下事物将如何变化的能力。由这组测试构成的科学理解基准(SUB)允许对不同方法进行评估与比较。基准测试在建立信任、确保质量控制和提供性能评估基础方面发挥着关键作用。通过使机器与人类科学理解相对齐,我们可以提升其效用,最终推进科学理解并助力在机器中发现新见解。
引用
@article{arxiv.2304.10327,
title = {Towards a Benchmark for Scientific Understanding in Humans and Machines},
author = {Kristian Gonzalez Barman and Sascha Caron and Tom Claassen and Henk de Regt},
journal= {arXiv preprint arXiv:2304.10327},
year = {2024}
}