中文

当模型知道超过其能解释的程度:衡量人类-人工智能协作中的知识迁移

人工智能 2025-06-10 v2 计算与语言 人机交互

摘要

近期的人工智能推理进展在各类任务上取得了显著性提升。一个关键的开放性问题是,这些改进是否也导致更好的知识迁移:即模型能够以人类可理解、可运用、可学习的方式传达推理过程。为探究此问题,我们引入知识集成与传输评估框架(Knowledge Integration and Transfer Evaluation, KITE),这是一种用于衡量人类-人工智能知识传输能力的概念性和实验性框架,并进行了首个大规模人类研究(N=118),旨在专门测量知识传输。在我们的两阶段设置中,人类首先与人工智能合作构思问题解决策略,然后独立实现解决方案,从而隔离模型解释对人类理解的影响。我们的发现表明,虽然模型基准性能与协作结果之间存在相关性,但这种关系存在显著不一致,出现明显异常值,表明知识迁移需要专门的优化。我们的分析识别了影响成功知识迁移的行为性和策略性因素。我们发布了代码、数据集和评估框架,以支持未来关于通信对齐模型的工作。

关键词

引用

@article{arxiv.2506.05579,
  title  = {When Models Know More Than They Can Explain: Quantifying Knowledge Transfer in Human-AI Collaboration},
  author = {Quan Shi and Carlos E. Jimenez and Shunyu Yao and Nick Haber and Diyi Yang and Karthik Narasimhan},
  journal= {arXiv preprint arXiv:2506.05579},
  year   = {2025}
}

备注

For code, data, visualizer, visit: https://kite-live.vercel.app