中文

EvalCards:标准化评估报告框架

计算与语言 2025-12-01 v1 人工智能 计算机与社会

摘要

评估始终是自然语言处理领域的核心关切,透明的报告实践在当今快速发布的开放模型时代尤为重要。我们基于对近期评估与文档工作的调查,识别出当前报告实践存在的三大持久性不足:可复现性、可获取性与治理。我们认为现有标准化努力仍不足,并提出评估披露卡(EvalCards)以迈出下一步。EvalCards 旨在提升研究者与实践者之间的透明度,同时为满足新兴治理要求提供实用基础。

关键词

引用

@article{arxiv.2511.21695,
  title  = {EvalCards: A Framework for Standardized Evaluation Reporting},
  author = {Ruchira Dhar and Danae Sanchez Villegas and Antonia Karamolegkou and Alice Schiavone and Yifei Yuan and Xinyi Chen and Jiaang Li and Stella Frank and Laura De Grazia and Monorama Swain and Stephanie Brandl and Daniel Hershcovich and Anders Søgaard and Desmond Elliott},
  journal= {arXiv preprint arXiv:2511.21695},
  year   = {2025}
}

备注

Under review