TEC:人类试错轨迹的问题求解集合
计算与语言
2026-04-13 v3
摘要
试错是人类解决复杂问题的基本策略,也是人工智能(AI)系统在现实环境中运行的必要能力。尽管最近提出了几种试错AI技术,但大多数依赖于研究人员设计的简单启发式方法,且性能提升有限。核心问题是缺乏适当的数据:当前模型无法从人类实际操作试错的详细记录中学习。为了填补这一空白,我们引入了一个数据标注平台和相应的数据集,称为试错集合(Trial-and-Error Collection, TEC)。该平台记录用户在多次试验中的完整轨迹,并在收到错误反馈后收集他们的反思。使用该平台,我们记录了46名参与者在58个任务上的问题求解过程,生成了5,370条试验轨迹以及跨41,229个网页的错误反思。通过该数据集,我们观察到人类的准确率显著高于大语言模型(LLMs),这表明人类在试错方面比LLMs更有效。我们相信TEC平台和数据集为理解人类试错行为和开发更有能力的AI系统提供了有价值的基础。平台和数据集公开可用。
引用
@article{arxiv.2604.06734,
title = {TEC: A Collection of Human Trial-and-error Trajectories for Problem Solving},
author = {Xinkai Zhang and Jingtao Zhan and Yiqun Liu and Qingyao Ai},
journal= {arXiv preprint arXiv:2604.06734},
year = {2026}
}