Ambig-DS:面向数据科学智能体的任务框架歧义基准
人工智能
2026-05-12 v1
摘要
随着数据科学智能体从副驾驶转向自动驾驶,静默的错误框架设定成为了一种关键的失效模式。智能体悄然承诺了看似合理但非预期的任务框架设定,生成干净、可执行的产物,却掩盖了它们对任务的错误评估。现有的基准测试仅对流水线是否运行进行评分,而忽略了智能体是否识别出任务规范不完整。我们引入了 Ambig-DS,包含两个诊断套件:一个用于预测目标歧义(Ambig-DS-Target,基于表格建模基准 DSBench 构建的 51 个任务),另一个用于评估目标歧义(Ambig-DS-Objective,基于 Kaggle 风格的机器学习竞赛基准 MLE-bench 构建的 61 个任务),这些任务的评分均使用各自源基准的原始评估器。对于每个任务,我们将原始的、完全指定的版本与通过受控编辑产生的歧义变体配对;一个人机与 LLM 结合的验证流水线确认每个变体都存在具有决策相关后果的多种合理解释。对这两个套件进行独立分析后发现,歧义在两者中均会降低性能。跨越从高效模型到前沿模型的五个智能体,我们在受控诊断设置中发现:(i) 失效是静默的承诺:在 Target 上提交错误的目标,在 Objective 上提交错误指标或非承诺的基线,而非执行错误;(ii) 允许智能体提出一个澄清问题可以在理想化条件下挽回大部分损失,这表明缺失的框架设定信息是导致观察到的性能退化的重要部分;但是 (iii) 智能体无法可靠地判断何时使用该机制:宽松的提示会在清晰的任务上导致过度提问,而保守的提示会在歧义任务上导致静默默认。识别目标和评估目标的不完整规范,而非流水线执行,才是标准数据科学智能体评估中缺失的瓶颈。
引用
@article{arxiv.2605.09698,
title = {Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents},
author = {Josefa Lia Stoisser and Marc Boubnovski Martell and Sidsel Boldsen and Kaspar Märtens and Robert Kitchen},
journal= {arXiv preprint arXiv:2605.09698},
year = {2026}
}