关于构建实用 NLP 排行榜的讨论:以机器翻译为例
计算与语言
2023-01-02 v2
摘要
AI 与 ML 应用的最新进展受益于 NLP 研究的快速推进。排行榜作为一种通过竞争性模型开发来追踪并加速 NLP 进展的流行机制而出现。尽管这提升了关注与参与,但对单一且基于准确率指标的过度依赖已将焦点从现实世界语境中同样可能相关的其他重要指标上移开。本文中,我们对仅关注准确率指标所带来的风险进行初步讨论,并借鉴近期讨论,提出关于如何开发更能反映模型现实效用的实用且有效排行榜的规范性建议。
引用
@article{arxiv.2106.06292,
title = {A Discussion on Building Practical NLP Leaderboards: The Case of Machine Translation},
author = {Sebastin Santy and Prasanta Bhattacharya},
journal= {arXiv preprint arXiv:2106.06292},
year = {2023}
}
备注
pre-print