中文

XDomainBench:高维科学知识组合中推理崩溃的诊断

人工智能 2026-05-15 v1

摘要

大型语言模型(LLM)正日益被部署用于知识综合,但其在科学知识方面的组合泛化能力仍未得到充分表征。现有的基准主要关注单轮受限场景,无法捕捉真实世界交互式科学工作流所暴露的能力边界。为了解决这一问题,我们引入了 XDomainBench,这是一个用于交互式跨学科科学推理的诊断基准。我们形式化了组合顺序和混合结构,以实现从单一学科到跨学科的系统化压力测试,包含跨 20 个领域和 4 个任务类别的 8,598 个交互式会话,以及涵盖难度和领域混合动态的 8 种现实轨迹模式,模拟真实的 AI4S 场景。对 LLM 的大规模评估表明,随着组合顺序的增加,系统会出现推理崩溃,这源于两个根本原因:(i)领域组合直接引发的难度增加,以及(ii)间接的交互放大失败,其中轨迹模式触发了误差累积、推理中断和领域混淆,最终导致会话崩溃。

关键词

引用

@article{arxiv.2605.14754,
  title  = {XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition},
  author = {Gong Zhiren and Tiantong Wu and Jiaming Zhang and Fuyao Zhang and Che Wang and Yurong Hao and Yikun Hou and Foo Ping and Yilei Zhao and Fei Huang and Chau Yuen and Wei Yang Bryan Lim},
  journal= {arXiv preprint arXiv:2605.14754},
  year   = {2026}
}