离散分布评估能否揭示捷径依赖?问答领域的案例研究
多智能体系统
2025-08-27 v1 人工智能
人机交互
摘要
AI 最近的大量工作通过评估模型在离散分布(OOD)数据集上的表现来衡量其泛化能力。尽管这种做法具有实用性,但这些评估建立在一个强假设之上:即 OOD 评估能够捕捉并反映实际部署中可能的失败模式。在本工作中,我们挑战了这一假设,并将 OOD 评估结果与现有问答(QA)模型中记录的若干特定失败模式进行了对话,这些模式被称为对虚假特征或预测捷径的依赖。我们发现,QA 中用于 OOD 评估的不同数据集提供的对捷径鲁棒性估计质量差异巨大,有些甚至连一个简单的分布内评估都表现不佳。我们部分归因于观察到虚假捷径在 ID+OOD 数据集中被共享,但也发现某些数据集在训练与评估方面的质量大不相同。我们的工作凸显了常用 OOD 基于评估的泛化评估的局限性,并为更稳健地评估问答领域内外的泛化提供了方法论和建议。
引用
@article{arxiv.2508.18406,
title = {Toward Generalized Autonomous Agents: A Neuro-Symbolic AI Framework for Integrating Social and Technical Support in Education},
author = {Ryan Hare and Ying Tang},
journal= {arXiv preprint arXiv:2508.18406},
year = {2025}
}
备注
Preprint. This work has been submitted to the IEEE for possible publication. In review for IEEE's Systems, Man, and Cybernetics Magazine. 8 pages, 3 figures. arxiv abstract has been shortened as the magazine format uses a long-form abstract