中文

您的模型显然高估了,而其他我们自以为是的谎言

计算与语言 2025-03-04 v1

摘要

特定示例固有的困难程度——其源于内在歧义——是评估神经 NLP 模型中一个关键但常被忽视的因素。我们探讨了各种用于评估内在困难程度指标之间的相互作用与差异,包括标注者 disagreement、训练动力学和模型置信度。通过在三个数据集上使用 29 个模型进行全面分析,我们发现尽管这些指标之间存在相关性,但它们的关系既非线性也非单调。通过解耦这些不确定性维度,我们旨在细化对数据复杂性及其对评估和改进 NLP 模型的影响的理解。

关键词

引用

@article{arxiv.2503.01235,
  title  = {Your Model is Overconfident, and Other Lies We Tell Ourselves},
  author = {Timothee Mickus and Aman Sinha and Raúl Vázquez},
  journal= {arXiv preprint arXiv:2503.01235},
  year   = {2025}
}