中文

无标注数据下能否可靠地跨域排序模型性能?

计算与语言 2025-10-13 v1

摘要

无标注数据下估计模型性能是理解NLP模型泛化能力的重要目标。尽管先前工作提出了基于数据集相似性或预测正确性的度量方法,但这些估计在跨域场景中何时能产生可靠的性能排序仍不明确。本文通过一个包含四个基础分类器和多个大语言模型作为错误预测器的两步评估设置,分析了影响排序可靠性的因素。在涵盖15个域的GeoOLID和Amazon Reviews数据集上的实验表明,基于大语言模型的错误预测器产生的与真实准确率的秩相关性更强且更一致,优于基于漂移的或零样本的基线方法。我们的分析揭示了两个关键发现:当各域之间的性能差异较大时排序更可靠,以及当错误模型的预测与基础模型的真实失败模式一致时排序更可靠。这些结果阐明了何时可以信任性能估计方法,并为跨域模型评估中的使用提供了指导。

关键词

引用

@article{arxiv.2510.09519,
  title  = {Can We Reliably Rank Model Performance across Domains without Labeled Data?},
  author = {Veronica Rammouz and Aaron Gonzalez and Carlos Cruzportillo and Adrian Tan and Nicole Beebe and Anthony Rios},
  journal= {arXiv preprint arXiv:2510.09519},
  year   = {2025}
}

备注

8 pages + references and Appendix